glogwa68/Qwen3-0.6B-DISTILL-glm-4.7-think - Каталог нейросетей
Генерация текста

glogwa68/Qwen3-0.6B-DISTILL-glm-4.7-think

Добавлено:
glogwa68/Qwen3-0.6B-DISTILL-glm-4.7-think

Эта модель представляет собой доработанную версию Qwen/Qwen3-0.6B, обученную на аргументированных разговорных данных из GLM 4.7 от Z.ai. — Базовая модель: Qwen/Qwen3-0.6B — Набор данных для точной настройки: TeichAI/glm-4.7-2000x — Длина контекста: 1048576 токенов — Специальная функция: мышление/рассуждение с помощью тегов — Эпохи: 2 — Скорость обучения: 2e-5 — Размер пакета: 8 (с накоплением градиента) — Точность: FP16 — Аппаратное обеспечение: Multi-GPU с ДипСпид ЗеРО-3

Модальности:
Генерация текста

Области применения:
Логика и рассуждение Диалог / чат


Задача: Генерация текста
Автор: glogwa68
Теги: qwen3, granite, fine-tuned, conversational, distillation, thinking, reasoning, en
Лайков: 7  |  Загрузок: 19

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.