Что произошло: при первоначальной загрузке (15 апреля 2026 г.) в рецепте llm-compressor использовался ignore=[«lmhead»], что означало, что 62 маршрутизатора MoE (blocksparsemoe.gate) были квантованы вместе с экспертными весами. Загрузчик MiniMax-M2 vLLM ожидает неквантованный маршрутизатор ReplicationLinear` и терпит неудачу при инициализации механизма с: Это жесткий сбой загрузки — механизм никогда не инициализируется, поэтому токены не генерируются. (Более ранняя формулировка «ухудшение качества вывода» преуменьшала серьезность.) Основная причина: отсутствие записей о MoE в списке игнорирования llm-compressor. Правильный шаблон (по saricles/MiniMax-M2.5-REAP-139B-A10B-NVFP4-GB10): Исправление: этот вариант был перевыпущен 16 апреля 2026 г. с исправленным рецептом. quantizationconfig.ignore теперь перечисляет все 62 шлюза маршрутизатора каждого уровня вместе с lmhead. Проверка: config.json в этом репозитории теперь содержит 62 записи model.layers.N.blocksparsemoe.gate в списке игнорирования. Загрузчики должны открыть модель без ошибки KeyError, указанной выше. Кредит: Спасибо пользователю сообщества, который первым сообщил об этом при загрузке NVFP4-GB10 DGX Spark. Справочный репозиторий сариклов оказался неоценимым для подтверждения точной закономерности. Незатронутые варианты (переброс не требуется): безопасные тензоры BF16, все квантования GGUF. НВФП4 — это…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: dervig
Теги: minimax_m2, minimax, moe, reap, nvfp4, fp4, blackwell, compressed-tensors
Лайков: 5 | Загрузок: 43
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.