thoughtworks/MiniMax-M2.5-Eagle3 - Каталог нейросетей
Генерация текста

thoughtworks/MiniMax-M2.5-Eagle3

Добавлено:
thoughtworks/MiniMax-M2.5-Eagle3

Легкая вытяжная головка EAGLE3 для MiniMax-M2.5 (229B MoE, ~10B активных параметров). Обучение проходило в SpecForge на 8 графических процессорах H200 с использованием тестового времени обучения EAGLE-3. Сообщение в блоге: В 2 раза быстрее на 229B MoE: спекулятивное декодирование EAGLE3 для MiniMax-M2.5 Требуется наша вилка SGLang для поддержки MiniMax-M2.5 Eagle3 + исправления dtype FP8. Сервер B=1 (широкое дерево — оптимально для однопользовательских запросов в реальном времени): Важно: используйте разные спекулятивные конфигурации для B=1 и B=32. Более широкое дерево (topk=4) использует простаивающие вычисления графического процессора при низкой пакетной обработке; узкое дерево (topk=1) минимизирует накладные расходы на отправку экспертами MoE при больших пакетах. EAGLE3 обучает одноуровневую черновую головку, которая прогнозирует следующий токен, используя скрытые состояния, полученные из трех вспомогательных слоев целевой модели (уровни 1, 30, 58 — ранний, средний и поздний). Целью обучения является потеря теста времени обучения (TTT), который имитирует процесс принятия/отклонения спекулятивного декодирования во время обучения, чтобы максимизировать ожидаемое количество принятых токенов во время вывода. Выпущенная модель была доработана для 6 дополнительных эпох на 20 тысячах регенерированных образцов из целевой модели. Ожидается, что точность точной настройки будет равна или выше этих базовых значений. Конфигурация:…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: thoughtworks
Теги: llama, eagle3, speculative-decoding, sglang, draft-model, moe, mixture-of-experts, en
Лайков: 7  |  Загрузок: 1,846

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.