4-битное (AWQ W4A16, только для экспертов) квантование MiMo-V2.5, упакованное для работы на NVIDIA A100 (SM80) под стандартной версией vLLM 0.21.0 — текст + изображение, TP-4 или TP-8. Базовая модель поставляется с fp8 (родная версия Hopper) и не работает на A100. Этот репозиторий представляет собой путь A100: веса int4 плюс два небольших патча кода модели vLLM, которые позволяют использовать внимание MiMo только для Hopper на Ampere — без изменения математических вычислений. — bf16 → int4: ≈581 ГБ → 169 ГБ — Контекст: до 1 048 576 токенов · текст + видение · вызов инструментов + рассуждения Путь vLLM MiMo по умолчанию жестко выбирает серверную часть FlashAttention-3 (только SM90+). Привяжите два файла патчей к копиям образа (подробности в PATCHES.md): — TP-4 тоже работает — установите —tensor-parallel-size 4. (Патчи корректны в обоих случаях; см. примечание QKV в PATCHES.md.) — Выборка: температура 1,0, topp 0,95 (модель поставляется в файле Generationconfig.json; режим мышления включен). — —max-model-len можно увеличить до исходного значения 1 048 576, если позволяет VRAM. AWQ W4A16, только для перенаправленных экспертов. Только прогнозы Routed-Expert MoE (mlp.experts.proj) квантуются до 4-битных. Все, что важно для качества, остается высокоточным: внимание, маршрутизатор/шлюз, общие пути, встраивания и lmhead, MTP и…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: spectator2026
Теги: vllm, mimo_v2, awq, int4, w4a16, quantized, moe, a100
Лайков: 5 | Загрузок: 949
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.