SamsungSAILMontreal/Qwen3-30B-A3B-Instruct-2507-REAM - Каталог нейросетей
Генерация текста

SamsungSAILMontreal/Qwen3-30B-A3B-Instruct-2507-REAM

Добавлено:
SamsungSAILMontreal/Qwen3-30B-A3B-Instruct-2507-REAM

Эта модель представляет собой сжатую версию Qwen/Qwen3-30B-A3B-Instruct-2507. Это достигается за счет сокращения количества экспертов на каждом уровне MoE со 128 до 96. Такое сокращение достигается с помощью метода REAM, описанного в https://bknyaz.github.io/blog/2026/moe/. Сжатая модель имеет 23 байта параметров (44 ГБ) вместо 31 байт (57 ГБ) исходной модели, что снижает требования к хранилищу и памяти графического процессора примерно на 25%. В то же время модель сохраняет >=94% производительности исходной модели в различных тестах (см. раздел «Оценка» ниже). Дополнительная оптимизация эффективности (например, квантование) может быть добавлена ​​аналогично исходной модели. Модель точно такая же, как Qwen/Qwen3-30B-A3B-Instruct-2507, за исключением того, что количество экспертов уменьшено со 128 до 96. Модель оценивается с использованием https://github.com/EleutherAI/lm-evaluation-harness/, за исключением LiveCodeBench, который оценивается с использованием https://github.com/LiveCodeBench/LiveCodeBench. — python >= 3.10 — torch: 2.7.1+cu126 — lm_eval: 0.4.9.1 — vllm: 0.10.1.1 — трансформаторы: 4.57.1 ​​- наборы данных: 3.2.0 — numpy: 1.26.4 Для задач IFEval, AIME25, GSM8K и HumanEval…

Модальности:
Генерация текста

Области применения:
Диалог / чат Следование инструкциям


Задача: Генерация текста
Автор: SamsungSAILMontreal
Теги: qwen3_moe, compression, expert-merging, moe, conversational, endpoints_compatible
Лайков: 7  |  Загрузок: 8

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.