Модель большого языка Mixtral-8x22B (LLM) представляет собой предварительно обученную генеративную разреженную смесь экспертов. Детали модели: — 🧠 ~176B параметров, ~44B активно во время вывода — 🪟 Контекстное окно 65K — 🕵🏾♂️ 8 экспертов, по 2 на токен — 🤓 Размер словарного запаса 32K — ✂️ Токенизатор, аналогичный модели 7B, квантованный и добавленный принцем Канумой с использованием модели полной точности здесь: v2ray/Mixtral-8x22B-v0.1. Mixtral-8x22B-v0.1 — это предварительно обученная базовая модель, поэтому она не имеет каких-либо механизмов модерации. Альбер Цзян, Александр Саблеролль, Алексис Такне, Антуан Ру, Артур Менш, Одри Херблин-Ступ, Батист Бут, Бодуэн де Моноко, Бланш Савари, Bam4d, Кэролайн Фельдман, Девендра Сингх Чаплот, Диего де лас Касас, Элеонора Арселин, Эмма Бу Ханна, Этьен Мецгер, Джанна Лендьел, Гийом Бур, Гийом Лампле, Харизо Раджаона, Жан-Мало Делиньон, Цзя Ли, Юстус Мерке, Луи Мартен, Луи Тернон, Люсиль Солнье, Лелио Ренар Лаво, Маргарет Дженнингс, Мари Пелла, Мари Торелли, Мари-Анн Лашо, Николя Шуль, Патрик фон Платен, Пьер Сток, Сандип Субраманиан, София Янг, Шимон Антониак, Тевен Ле Скао, Тибо Лавриль, Тимоти Лакруа, Теофиль Жерве, Томас Ванг, Валера Немычникова, Уильям…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: mistral-community
Теги: mixtral, moe, fr, it, de, es, en, text-generation-inference
Лайков: 55 | Загрузок: 11
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.