𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE 📄 Бумага • 💻 Код • 📝 Блог > ⚠️ Примечание. Это повторная загрузка квантованной и обрезанной модели MiniMax-M2.1-REAP-50-W4A16 от 0xSero. > Первоначальный создатель (0xSero) явно разрешил эту повторную загрузку. > Вся заслуга в работе по квантованию и сокращению принадлежит 0xSero. 50% Expert-Pruned + INT4 Quantized — двойное сжатие для эффективного развертывания. — REAP + AutoRound: экспертное сокращение + весовое квантование. — Оптимизировано для кода и инструментов: калибровка при генерации кода и вызове функций. — Меньшее количество видеопамяти: подходит для 96 ГБ видеопамяти. 50% экспертной обрезки MiniMax-M2.1 с использованием REAP (экспертная обрезка активации с учетом маршрутизатора). Протестировано при 4 температурах (0,0, 0,2, 0,7, 1,0) для 6 типов запросов. (всего 24 теста): Наблюдения за стресс-тестами MiniMax-M2.1 REAP Коэффициент сокращения 50% обеспечивает баланс: — Уменьшение размера: 116B по сравнению с исходным размером 456B (на 75% меньше) — Производительность: минимальное ухудшение качества из-за стратегического экспертного выбора — За счет стабильности: 2 цикла в комплексном стресс-тестировании Использование коэффициента пробега 40% обеспечит в целом лучший баланс. > Примечание. Ссылки в таблице выше указывают на оригинальные модели в аккаунте 0xSero, некоторые…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: plezan
Теги: minimax_m2, minimax, moe, reap, pruned, cerebras, quantized, gptq
Лайков: 5 | Загрузок: 30
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.