MiniMax-Text-01 — это мощная языковая модель с 456 миллиардами параметров, из которых 45,9 миллиардов активируются на каждый токен. Чтобы лучше раскрыть возможности модели с длинным контекстом, MiniMax-Text-01 использует гибридную архитектуру, сочетающую в себе Lightning Attention, Softmax Attention и Mixture-of-Expertions (MoE). Используя передовые параллельные стратегии и инновационные методы перекрытия вычислений и коммуникаций, такие как Linear Attention Sequence Parallelism Plus (LASP+), кольцевое внимание варленов, Expert Tensor Parallel (ETP) и т. д., длина контекста обучения MiniMax-Text-01 увеличена до 1 миллиона токенов, и он может обрабатывать контекст до 4 миллионов токенов во время вывода. В различных академических тестах MiniMax-Text-01 также демонстрирует производительность модели высшего уровня. Архитектура MiniMax-Text-01 кратко описывается следующим образом: — Всего параметров: 456B — Активированных параметров на каждый токен: 45,9B — Число слоев: 80 — Гибридное внимание: предупреждение softmax размещается после каждых 7 молниеносных предупреждений. — Количество голов внимания: 64 — Размер головы внимания: 128 — Состав экспертов: — Количество экспертов: 32 — Скрытое измерение экспертов: 9216 — Стратегия маршрутизации Топ-2 -…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: MiniMaxAI
Теги: minimax_text_01, conversational, custom_code
Лайков: 654 | Загрузок: 1,198
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.