— 15 февраля 2026 г.: требуется обеспечить качество — пакетный размер = 1 (поток) и добавлен греческий язык и многоязычный набор данных 34 (запрос). — 14 февраля 2026 г.: исходный количественный анализ с использованием новой функции LLMcompressor пакетный размер = 32. Batchsize` может негативно повлиять на калибровку из-за усечения или дополнения наборов данных, что противоречит сделанному мной тщательному выбору. Это квант высочайшего качества, который может работать на 192 ГБ видеопамяти > [!TIP] > 💡Это родственная модель mratsim/MiniMax-M2.5-FP8-INT4-AWQ > с весами исходной модели FP8, предварительно деквантованными до BF16. > > Это делает его совместимым с системами 8×3090 (которые не имеют аппаратного обеспечения FP8), > а также совместимым с SGLang для дополнительных 3 ГиБ видеопамяти. В ней представлены: — Эта модель гарантирует калибровку всех экспертов, невыполнение этого крайне вредно, PR: https://github.com/vllm-project/llm-compressor/pull/2171 💡[Нажмите на меня!] Наглядная демонстрация того, почему важно обеспечить квантование всех экспертов МО — Источник: https://avtc.github.io/aquarium-side-by-side/ — Контекст: https://github.com/ModelCloud/GPTQModel/pull/2235 — Смешанная точность с: — весами самообслуживания, деквантованными из официальной версии. — экспертные веса квантованы с использованием AWQ W4A16G32…
Модальности:
Генерация текста
Области применения:
Генерация кода Диалог / чат
Задача: Генерация текста
Автор: mratsim
Теги: llm-compressor, minimax_m2, fp8, awq, conversational, vllm, code, devops
Лайков: 38 | Загрузок: 17,809
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.