Эта модель представляет собой смесь экспертов (MoE), созданную с помощью mergekit (микстральная ветвь). Он использует следующие базовые модели: openchat/openchat-3.5-1210 beowolx/CodeNinja-1.0-OpenChat-7B maywell/PiVoT-0.1-Starling-LM-RP WizardLM/WizardMath-7B-V1.1 GGUF: https://huggingface.co/TheBloke/Beyonder-4x7B-v2-GGUF AWQ: https://huggingface.co/TheBloke/Beyonder-4x7B-v2-AWQ GPTQ: https://huggingface.co/TheBloke/Beyonder-4x7B-v2-GPTQ EXL2: https://huggingface.co/bartowski/Beyonder-4x7B-v2-exl2 Beyonder-4x7B-v2 конкурирует с Mixtral-8x7B-Instruct-v0.1 в таблице лидеров Open LLM, хотя у него всего 4 эксперта вместо 8. Он также демонстрирует значительное улучшение по сравнению с отдельными экспертами. Он также работает очень хорошо по сравнению с другими моделями в наборе тестов Nous. Это почти так же хорошо, как лучшая модель тонкой настройки Yi-34B, которая представляет собой гораздо большую модель: 24,2 млрд параметров + во время вывода выбираются только два эксперта (то есть ~ 12 млрд) против 34 млрд параметров. Вот ноутбук для запуска этой модели с 4-битной точностью с использованием бесплатного графического процессора T4 в Google Colab. > Смесь экспертов (ME) — это метод машинного обучения, который объединяет несколько экспертных моделей для прогнозирования или принятия решений. Каждая экспертная модель специализируется на…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: mlabonne
Теги: mixtral, moe, merge, mergekit, Mistral, openchat/openchat-3.5-1210, beowolx/CodeNinja-1.0-OpenChat-7B, maywell/PiVoT-0.1-Starling-LM-RP
Лайков: 128 | Загрузок: 815
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.