Эта модель представляет собой доработанную версию Qwen/Qwen3-0.6B, обученную на аргументированных разговорных данных из GLM 4.7 от Z.ai. — Базовая модель: Qwen/Qwen3-0.6B — Набор данных для точной настройки: TeichAI/glm-4.7-2000x — Длина контекста: 1048576 токенов — Специальная функция: мышление/рассуждение с помощью тегов — Эпохи: 2 — Скорость обучения: 2e-5 — Размер пакета: 8 (с накоплением градиента) — Точность: FP16 — Аппаратное обеспечение: Multi-GPU с ДипСпид ЗеРО-3
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: glogwa68
Теги: qwen3, granite, fine-tuned, conversational, distillation, thinking, reasoning, en
Лайков: 7 | Загрузок: 19
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.