Этот репозиторий предназначен в первую очередь для платформы Transformers. Если вы используете другие платформы с открытым исходным кодом, используйте альтернативный репозиторий: MiniMax-Text-01 MiniMax-Text-01 — это мощная языковая модель с 456 миллиардами общих параметров, из которых 45,9 миллиардов активируются для каждого токена. Чтобы лучше раскрыть возможности модели с длинным контекстом, MiniMax-Text-01 использует гибридную архитектуру, сочетающую в себе Lightning Attention, Softmax Attention и Mixture-of-Expertions (MoE). Используя передовые параллельные стратегии и инновационные методы перекрытия вычислений и коммуникаций, такие как Linear Attention Sequence Parallelism Plus (LASP+), кольцевое внимание варленов, Expert Tensor Parallel (ETP) и т. д., длина контекста обучения MiniMax-Text-01 увеличена до 1 миллиона токенов, и он может обрабатывать контекст до 4 миллионов токенов во время вывода. В различных академических тестах MiniMax-Text-01 также демонстрирует производительность модели высшего уровня. Архитектура MiniMax-Text-01 кратко описывается следующим образом: — Всего параметров: 456B — Активированных параметров на каждый токен: 45,9B — Число слоев: 80 — Гибридное внимание: предупреждение softmax размещается после каждых 7 молниеносных предупреждений. — Количество…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: MiniMaxAI
Теги: minimax, moe, conversational, endpoints_compatible
Лайков: 11 | Загрузок: 30,448
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.