ViAble-1.7-9B — это ориентированная на рассуждения тонкая настройка Qwen 3.5 9B (архитектура qwen35): контролируемая тонкая настройка на ~98 тыс. следов дистилляции с последующей фазой GRPO. Этот репозиторий содержит объединенные веса bf16 ** (адаптер не требуется). > Требуются трансформаторы>=5.15.1 (версия, которая добавляет поддержку qwen35). Всегда загружайте с помощью trustremotecode=True`. — База: Qwen 3.5 9B — 9B params, 32 слоя (плотное гибридное внимание, архитектура qwen35`). — SFT: 1 эпоха на 98 455 образцах дистилляции (r0b0tlab/qwen3.8-max-glm5.2-kimi-k3-distillation, canonical), LoRA r=64 / alpha=128, seq 2048, bf16, lr 2e-4 cosine, эффективная партия 16 (~6154 шагов). — GRPO: непрерывное обучение (~3000 шагов, 4 поколения/подсказка, бета 0,04, lr 5e-6). — Аппаратное обеспечение: графические процессоры Kaggle (RTX 6000 Pro для обучения). Протокол оценки (оба запуска): шаблон чата от tokenizerconfig.json, системная подсказка запрашивает пошаговое мышление; этап 1 позволяет модели думать (до 1024 токенов), этап 2 заставляет окончательный ответ (правильный ответ — X / boxed{…}`) для образцов, которые не завершились. Эти прогоны выполнялись на вычислениях ограниченного свободного уровня (Kaggle T4 / RTX 6000 Pro), поэтому: — MMLU здесь оценивается в целом (модель пишет ответное письмо), а не…
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: bogairff55
Теги: qwen3_5_text, reasoning, conversational, en, endpoints_compatible
Лайков: 4 | Загрузок: 1,176
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.