Xiaoye08/HRM-MoE - Каталог нейросетей
Генерация текста

Xiaoye08/HRM-MoE

Добавлено:
Xiaoye08/HRM-MoE

HRM-MoE — это редкое расширение HRM-Text, состоящее из нескольких экспертов. Этот выпуск представляет собой предварительно обученную контрольную точку MoE 64×8 эпохи 4, экспортированную из собственной контрольной точки FSDP2 в один файл bf16 model.safetensors. Основным моментом этой контрольной точки является разреженная активация: модель имеет всего 5,41 млрд параметров, но каждый токен активирует только топ-8 из 64 экспертов, примерно по 1,19 млрд активных параметров на токен (21,9% от полного пула параметров). Другими словами, он сохраняет активные вычисления близкими к плотному HRM-Text-1B, предоставляя модели гораздо больший пул экспертных параметров. Это базовая контрольная точка перед выравниванием. Это не чат или помощник, выполняющий инструкции. Активная ширина FFN намеренно согласована с плотной базовой линией XL, а разреженный пул экспертов увеличивает общую емкость. В приведенном ниже сравнении используется тот же конвейер предварительного обучения HRM, те же выборочные данные предварительного обучения, та же настройка с 32 графическими процессорами и 4 эпохи предварительного обучения. Значения представляют собой проценты, если не указано иное. Эта контрольная точка использует специальную архитектуру hrmtextmoe через Hugging Facetrustremotecode=True. Путь вывода удаленного кода является автономным и использует внимание PyTorch плюс сгруппированный экспертный BMM. Рекомендуется использовать графические процессоры класса Hopper…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: Xiaoye08
Теги: hrm_text_moe, hrm, hierarchical-reasoning, mixture-of-experts, moe, sparse-activation, prefix-lm, pre-alignment
Лайков: 8  |  Загрузок: 273

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.