Квантование смешанной точности с совместной экспертной обрезкой. Подходит для MoE с параметром 228 B в 90 ГБ на одном DGX Spark, обслуживаемом vLLM без каких-либо исправлений. Источник: MiniMaxAI/MiniMax-M2.7 Квантизатор: prismaquant · фиксация, закрепленная в файле mixnativemanifest.json этого артефакта prismaquant решает задачу с несколькими вариантами выбора по линейной стоимости/выборам памяти для достижения целевого битового бюджета. В этот артефакт вносятся два различных вклада: $$Deltamathrm{loss} approx tfrac{1}{2} cdot H{text{trace}} cdot mathrm{MSE}W$$ — Htrace — это эмпирическая диагональная трасса Фишера, полученная за один потоковый проход вперед+назад по калибровочному набору. Он измеряет, насколько изогнуты потери перекрестной энтропии в этой линейной зависимости: высокий Htrace означает, что небольшое изменение веса сильно увеличивает потери. — MSEW — измеренная** двусторонняя ошибка веса для каждого формата (NVFP4, FP8, BF16). Это не аналитическая формула — мы запускаем RTN для фактических весов и напрямую вычисляем ошибку. Умножение дает оценку Тейлора второго порядка того, насколько вырастут потери модели, если вы замените вес BF16 квантованной версией формата. Распределитель выбирает линейные форматы, которые минимизируют общие потери Δ с учетом общего количества битов…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: rdtand
Теги: vllm, minimax_m2, prismaquant, mixed-precision, quantization, nvfp4, fp8, moe
Лайков: 10 | Загрузок: 1,725
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.