ФранкенМЭ, использующий SOLAR 10.7B в качестве архитектуры. Используются следующие модели: — bhavinjawade/SOLAR-10B-Nector-DPO-Jawade — база — bhavinjawade/SOLAR-10B-Nector-DPO-Jawade — эксперт №1 — NousResearch/Nous-Hermes-2-SOLAR-10.7B — эксперт №2 — Sao10K/Sensualize-Solar-10.7B — эксперт №3 — NousResearch/Nous-Hermes-2-SOLAR-10.7B — эксперт №4 — bhavinjawade/SOLAR-10B-Nector-DPO-Jawade — эксперт №5 — Sao10K/Sensualize-Solar-10.7B — эксперт №6 — Sao10K/SOLAR-10.7B-NahIdWin — эксперт №7 — bhavinjawade/SOLAR-10B-Nector-DPO-Jawade — эксперт №8 Масштаб модели является одной из наиболее важных осей повышения качества модели. При фиксированном вычислительном бюджете обучение более крупной модели меньшему количеству шагов лучше, чем обучение меньшей модели большему количеству шагов. Смесь экспертов позволяет предварительно обучать модели с гораздо меньшими вычислительными затратами, что означает, что вы можете значительно увеличить размер модели или набора данных с тем же бюджетом вычислений, что и плотная модель. В частности, модель MoE должна достичь того же качества, что и ее плотный аналог, гораздо быстрее во время предварительного обучения. Итак, что же такое МО? В контексте моделей трансформаторов MoE состоит из двух основных элементов: разреженные слои MoE используются вместо плотных…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: ConvexAI
Теги: mixtral, merge, moe, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 49
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.