GestaltLabs/BOREAL-10B-MoE - Каталог нейросетей
Генерация текста

GestaltLabs/BOREAL-10B-MoE

Добавлено:
GestaltLabs/BOREAL-10B-MoE

Цель. Гибридная языковая модель Mixture of Experts с ~10 миллиардами параметров и ~2 миллиардами активных параметров на токен. Обучение с нуля на 15–20 триллионах токенов с использованием обучения суперпозиции токенов. BOREAL-10B-MoE сочетает в себе архитектуру Gated DeltaNet, проверенную Qwen3.5/3.6, с экспертной маршрутизацией на основе хеш-функции DeepSeek-V4. Результат: модель, которая достигает уровней Qwen3.5-9B с ~2B активных параметров, собственным контекстом 256K и пропускной способностью вывода, конкурентоспособной с моделями, в 4–5 раз превышающими ее активный размер. Слои MoE чередуются после первых четырех плотных прогревающих слоев, создавая среду с богатым градиентом, в которой специализация экспертов может естественным образом возникать наряду с периодическим накоплением состояний DeltaNet. Оценка сигмовидной кишки. В отличие от маршрутизации softmax (которая требует наличия одного доминирующего эксперта), сигмовидная оценка позволяет нескольким экспертам активироваться независимо. Каждый эксперт самостоятельно решает, сможет ли он помочь с текущим токеном. noauxtc.** Никаких вспомогательных потерь для балансировки нагрузки. Вместо этого у каждого эксперта есть обучаемый термин смещения, который корректируется во время обучения, чтобы естественным образом сбалансировать нагрузку между экспертами. Это позволяет избежать ухудшения качества, которое вызывают потери балансировки вспомогательной нагрузки…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: GestaltLabs
Теги: boreal, deltanet, hybrid, moe, mixture-of-experts, linear-attention, swiglu, rmsnorm
Лайков: 9  |  Загрузок: 0

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.