allenai/StdMoE_1b4b_130B - Каталог нейросетей
Генерация текста

allenai/StdMoE_1b4b_130B

Добавлено:
allenai/StdMoE_1b4b_130B

Стандартный базовый уровень MoE, соответствующий памяти, выпущенный вместе с EMO: Pretraining Mixture of Experts for Emergent Modularity, называемый «Reg. MoE @ 32» на рисунке 1 документа. Не среднетренированный. 1B-активный / 4B-общий параметр Модель смеси экспертов (32 маршрутизированных эксперта + 1 общий, k = 8 активных на токен), предварительно обученная с нуля на 130B токенах смеси предварительного обучения OLMoE со стандартной целью MoE. Обеспечивает сопоставленную с памятью точку сравнения с 32 экспертными подмножествами, выделенными из более крупных моделей EMO 1B/14B. Эта модель распространяется по лицензии Apache 2.0. Он предназначен для исследовательского и образовательного использования в соответствии с Руководством по ответственному использованию Ai2. Документ: https://arxiv.org/abs/2605.06663. Код: https://github.com/allenai/EMO.

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: allenai
Теги: emo, moe, mixture-of-experts, baseline, ablation, memory-matched, conversational, custom_code
Лайков: 5  |  Загрузок: 403

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.