Квантованная версия MiniMaxAI/MiniMax-M2.1 NVFP4 для эффективного вывода на графических процессорах NVIDIA Blackwell. — Формат: NVFP4 с двухуровневым масштабированием (блочный FP8 + глобальный FP32) — Схема: сжатые тензоры с квантованным форматом nvfp4-pack — Цель: все линейные слои в центре внимания и эксперты Министерства образования — Размер группы: 16 — Графический процессор NVIDIA Blackwell (RTX 5090, RTX PRO 6000 и т. д.) — vLLM с поддержкой flashinfer-cutlass NVFP4 — ~130 ГБ видеопамяти (TP=2 рекомендуется для конфигураций с двумя графическими процессорами) То же, что и у базовой модели — подробности см. в MiniMaxAI/MiniMax-M2.1. — MiniMax для оригинальной модели MiniMax-M2.1 — команда vLLM для поддержки квантования NVFP4
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: GadflyII
Теги: minimax_m2, minimax, moe, nvfp4, quantized, vllm, blackwell, conversational
Лайков: 7 | Загрузок: 9
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.