Это первая экспериментальная попытка создания языковой модели Mixture of Experts (MoE) путем объединения нескольких экспертных моделей Mistral. Модель использует в качестве основы архитектуру Hyperion-3.0-beta с выходным типом данных bfloat16. Механизм шлюзования установлен на скрытый режим, и для каждого токена проводятся консультации с двумя экспертами (expertspertoken: 2). Модель включает в себя три экспертные модели: 1. Hyperion-3.0-beta: ориентирована на естественные науки, математику и задачи по программированию. 2. dibt-mistral-7b: обрабатывает открытые вопросы, обобщение и поток сознания. 3. rp-mistral-7b: Специализируется на ролевых играх и разговорах между персонажами. Каждый эксперт обучен набору положительных и отрицательных подсказок, которые помогут ему в своей специализации. Эта модель MoE является ранним прототипом и может не показывать оптимальные характеристики. Он предназначен только для исследовательских и экспериментальных целей и не должен использоваться в производственных средах или критически важных приложениях. Обратите внимание, что экспертные модели, упомянутые в конфигурации, еще не опубликованы. Ожидается, что они будут доступны в ближайшем будущем, после чего эта модель МО может быть полностью реализована и оценена. Базовая модель и эксперты прошли обучение…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Locutusque
Теги: mixtral, moe, en, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 52
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.