Первый общедоступный вариант MiniMax-M2.7 с обрезанным REAP-40%, выпущенный m51Lab 15 апреля 2026 г. — Метод: REAP (Lasby et al. 2025, arXiv:2510.13999) — Скорость сокращения: 40 % экспертов на блок MoE (256 → 154) — Начальное число: 42 — Перенормировка маршрутизатора: включена — Длина последовательности калибровки: 2 048 токенов — Эффективные выборки: 6 144 упакованы в три набора данных ниже — Измерение расстояния: косинус — Эксперты по супер/выбросам Singleton: отключены. Этот микс отражает общедоступные выпуски Cerebras MiniMax-M2/M2.1/M2.5 REAP. Для задач, в которых модель завершала свои рассуждения в рамках бюджета генерации 32 K-токенов, этот вариант (REAP-40 % сокращенный + Q4KM) правильно решал 90 из 108 — сильный сигнал качества для 4-битного квантованного, структурно сокращенного MoE. Строгое прохождение @ 1 (все 164 задачи, ограничения считаются неудачными): 54,9 % 56 из 164 задач исчерпали бюджет рассуждений в 32 тыс. в середине и считаются неудачными при строгой академической оценке. Это показатель производственного развертывания, если вы ограничиваете генерацию 32 тыс. токенов; выделите ≥64 тыс. токенов, чтобы приблизиться к потолку в 83 %. Методология: 2 × H100 80 ГБ, llama.cpp /v1/chat/completions, встроенная функция включена, температура = 0,2, topp = 0,95, максимальное количество токенов = 32000. Нет…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: dervig
Теги: minimax_m2, minimax, moe, reap, pruning, conversational, custom_code, endpoints_compatible
Лайков: 5 | Загрузок: 35
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.