Соответствующая архитектуре стандартная базовая линия МОС, выпущенная вместе с EMO: Смесь экспертов по предварительной подготовке для возникающей модульности — называемая Reg. MoE (или «стандартный MoE») на 1T токенов в бумаге. 1B-active / 14B-total параметр Mixture-of-Experts model (128 experts: 127 routed 1 shared, k=8 active per token) предварительно обучен на 1T токенах предварительной обучающей смеси OLMoE и отожжен для дополнительных 50B токенов со стандартной целью MoE (без ограничения пула экспертов на уровне документа). Та же архитектура и настройка обучения, что и Emo1b14b1T, отличающаяся только целью обучения. Данная модель лицензирована под Apache 2.0. Он предназначен для исследовательского и образовательного использования в соответствии с Руководством по ответственному использованию Ai2 — Документ: https://arxiv.org/abs/2605.06663 — Код: https://github.com/allenai/EMO
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: allenai
Теги: emo, moe, mixture-of-experts, baseline, conversational, custom_code, en
Лайков: 4 | Загрузок: 317
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.