QLoRA точная настройка NVIDIA Nemotron-3-Super-120B-A12B (всего 120B / 12B-активный гибрид Mamba-2 + Latent-MoE, nemotronh) на пиагентном разделении трасс Glint-Research/Fable-5, целевых рассуждениях, агентном планировании и использовании инструментов. В этом репозитории хранится экспорт GGUF для LM Studio/llama.cpp. > Требуется сборка llama.cpp с поддержкой немотронхмоэ (PR #18058 или новее). Последние > среды выполнения LM Studio включают его. Использует шаблон ChatML, встроенный в GGUF. — Метод: QLoRA (4-битная база NF4) через Unsloth. LoRA r=8, α=16, отсев=0, смещение=нет. Целевое (по регулярному выражению) внимание q/k/v/oproj, inproj/outproj Мамбы-2 и up/downproj всех 512 перенаправленных экспертов + общий эксперт — этот MoE не является закрытым, поэтому up/downproj является полным экспертным FFN (воротного проекта нет). Маршрутизатор MoE (mixer.gate, nn.Parameter) и MoE-latent fc1/fc2latentproj остаются замороженными. — Данные: Glint-Research/Fable-5-traces, config piagent, ChatML, потеря только ответа. — Расписание: 1 эпоха (248 шагов), град-аккум 16, лр 2е-5 косинус + прогрев. — Окончательные потери при обучении: ≈0,74 истинных CE на токен (среднее значение на конечной фазе; потери журналов Unsloth × grad-accum, поэтому необработанное зарегистрированное значение здесь составляет ÷16). — Оценка (вытянутый пиагант Fable-5, 81 ряд, основа →…
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат Вызов функций (Tool use)
Задача: Генерация текста
Автор: greghavens
Теги: gguf, nemotron, nemotron_h, mamba2, mixture-of-experts, llama.cpp, lm-studio, qlora
Лайков: 5 | Загрузок: 539
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.