allenai/StdMoE_1b14b_1T_Preanneal - Каталог нейросетей
Генерация текста

allenai/StdMoE_1b14b_1T_Preanneal

Добавлено:
allenai/StdMoE_1b14b_1T_Preanneal

Контрольная точка предварительного отжига стандартной базовой линии MoE, выпущенная вместе с EMO: Pretraining Mixture of Experts for Emergent Modularity. Это отправная точка для эксперимента по отжигу EMO, описанного в Приложении B.4 к статье, в котором полностью предварительно обученный стандартный MoE отжигается с целью EMO, чтобы проверить, можно ли вызвать модульность после предварительного обучения. 1B-активный / 14B-общий параметр Модель Mixture-of-Experts (128 экспертов: 127 перенаправленных + 1 общий, k=8 активных на токен), предварительно обученная на токенах 1T из набора предварительной подготовки OLMoE со стандартной целью MoE. Отжиг не применялся. Эта модель распространяется по лицензии Apache 2.0. Он предназначен для исследовательского и образовательного использования в соответствии с Руководством по ответственному использованию Ai2. Документ: https://arxiv.org/abs/2605.06663. Код: https://github.com/allenai/EMO.

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: allenai
Теги: emo, moe, mixture-of-experts, baseline, pre-annealing, conversational, custom_code, en
Лайков: 5  |  Загрузок: 232

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.