bknyaz/Qwen3-Next-80B-A3B-Instruct-REAM - Каталог нейросетей
Генерация текста

bknyaz/Qwen3-Next-80B-A3B-Instruct-REAM

Добавлено:
bknyaz/Qwen3-Next-80B-A3B-Instruct-REAM

Эта модель представляет собой сжатую версию Qwen/Qwen3-Next-80B-A3B-Instruct. Его получают за счет сокращения количества экспертов на каждом уровне MoE с 512 до 384. Такое сокращение достигается с помощью метода REAM, описанного в https://bknyaz.github.io/blog/2026/moe/. Сжатая модель имеет 60 байт параметров (120 ГБ) вместо 80 байт (160 ГБ) исходной модели, что снижает требования к хранилищу и памяти графического процессора примерно на 25%. В то же время модель сохраняет >=95% производительности исходной модели в различных тестах (см. раздел «Результаты» ниже). Дополнительная оптимизация эффективности (например, квантование) может быть добавлена ​​аналогично исходной модели. 27 февраля 2026 г.: Qwen3-Next-80B-A3B-Instruct-REAMv2 — версия обновления сжата с дополнительными данными кода. В частности, соотношение между c4, математическими данными и данными кодирования (см. https://bknyaz.github.io/blog/2026/moe/) составляет 0,0, 0,3, 0,7. — C=32 (количество экспертов в группах) вместо C=16, что, по нашему мнению, работает лучше. — Слой MTP также сжимается и добавляется в модель согласно исходной модели Qwen3-Next-80B-A3B-Instruct. MTP был протестирован с помощью —speculative-config ‘{«method»:»qwen3nextmtp»,»numspeculativetokens»:2}’, и на GSM8K производительность находилась в пределах 1%. …

Модальности:
Генерация текста

Области применения:
Диалог / чат Следование инструкциям


Задача: Генерация текста
Автор: bknyaz
Теги: qwen3_next, compression, expert-merging, moe, conversational, endpoints_compatible
Лайков: 5  |  Загрузок: 109

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.