> ⚠ Экспериментальная проверка концепции — предупреждение о качестве > > Эта контрольная точка была создана в качестве теста сквозного конвейера REAP → AutoRound → vLLM на одном NVIDIA GB10 / DGX Spark. Поскольку калибровочная машина имела ограниченный объем памяти и настенных часов, экспертный проход REAP был выполнен только с 64 калибровочными последовательностями из theblackcat102/evol-codealpaca-v1 с длиной последовательности 512. Качество последующего процесса все еще оценивается. Урезанный REAP и квантованный AutoRound W4A16 вариант MiniMax-M2.7. Первоначальный MoE с 256 экспертами на уровень был уменьшен до 192 экспертов на уровень (сжатие 25 %) с использованием сокращения значимости экспертов REAP, а затем квантовано до 4-битных весов / 16-битных активаций с помощью Intel AutoRound. В результате получается контрольная точка размером ~86 ГиБ, которая комфортно работает на одном NVIDIA GB10/DGX Spark (унифицированная память 128 ГиБ), а также на любом графическом процессоре CUDA с ядром vLLM Marlin/GPTQ-Marlin W4A16. — Базовая модель: семейство MiniMaxAI/MiniMax-M2 (архитектура MiniMaxM2) — Сокращение: REAP (Cerebras) — сжатие 25 % → 192/256 экспертов на слой — Калибровка: theblackcat102/evol-codealpaca-v1, 64 выборки, начальное число 42 — Квантование: AutoRound 0.12.2, W4A16, размер группы 128, симметричный, GPTQ…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: MJPansa
Теги: minimax_m2, moe, mixture-of-experts, quantization, auto-round, autoround, w4a16, int4
Лайков: 9 | Загрузок: 1,562
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.