Доработанная версия google/gemma-4-26B-A4B-it на основе высококачественных следов рассуждений, извлеченных из Claude Opus 4.6. – Базовая модель: google/gemma-4-26B-A4B-it (MoE, 3,8B активных параметров) – Набор данных: Crownelius/Opus-4.6-Reasoning-3300x – Метод: LoRA SFT (r=16, альфа=16) – Обучение: 1 эпоха, 2160 примеров, 540 шагов – Аппаратное обеспечение: NVIDIA H100 80 ГБ – Платформа: Unsloth + TRL — Итоговая потеря: 0,751 — Структурированное пошаговое рассуждение (думание перед ответом) — Более точные ответы на сложные многоэтапные задачи — Лучшее решение математических и алгоритмических задач — Согласованное форматирование/форматирование ответа — Минимум: 14 ГБ видеопамяти (RTX 3090, RTX 4080, RTX 5060 Ti 16 ГБ) — Рекомендуемый контекст: 32 000 токенов с кэшем KV q40 – Общее использование видеопамяти:** ~13 ГБ в контексте 32 КБ.
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: rico03
Теги: gguf, gemma4, reasoning, fine-tuned, unsloth, lora, en, it
Лайков: 7 | Загрузок: 222
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.