Стандартный базовый уровень MoE, соответствующий памяти, выпущенный вместе с EMO: Pretraining Mixture of Experts for Emergent Modularity, называемый «Reg. MoE @ 32» на рисунке 1 документа. Не среднетренированный. 1B-активный / 4B-общий параметр Модель смеси экспертов (32 маршрутизированных эксперта + 1 общий, k = 8 активных на токен), предварительно обученная с нуля на 130B токенах смеси предварительного обучения OLMoE со стандартной целью MoE. Обеспечивает сопоставленную с памятью точку сравнения с 32 экспертными подмножествами, выделенными из более крупных моделей EMO 1B/14B. Эта модель распространяется по лицензии Apache 2.0. Он предназначен для исследовательского и образовательного использования в соответствии с Руководством по ответственному использованию Ai2. Документ: https://arxiv.org/abs/2605.06663. Код: https://github.com/allenai/EMO.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: allenai
Теги: emo, moe, mixture-of-experts, baseline, ablation, memory-matched, conversational, custom_code
Лайков: 5 | Загрузок: 403
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.