tl;dr: AlphaMonarch-7B — это новое слияние DPO, которое сохраняет все мыслительные способности самых лучших слияний и значительно улучшает его разговорные способности. Лучшее из обоих миров в модели 7B. 🎉 AlphaMonarch-7B — это DPO, доработанный для mlabonne/NeuralMonarch-7B с использованием набора данных предпочтений argilla/OpenHermes2.5-dpo-binarized-alpha. Он основан на слиянии следующих моделей с использованием LazyMergekit: mlabonne/OmniTruthyBeagle-7B-v0 mlabonne/NeuBeagle-7B * mlabonne/NeuralOmniBeagle-7B Особая благодарность Джону Дурбину, Intel, Argilla и Teknium за наборы данных предпочтений. Попробуйте демо: https://huggingface.co/spaces/mlabonne/AlphaMonarch-7B. Эта модель использует контекстное окно размером 8 КБ. Я рекомендую использовать его с шаблоном чата Mistral Instruct (отлично работает с LM Studio). Если вы используете SillyTavern, возможно, вам захочется настроить параметры вывода. Вот что LM Studio использует в качестве эталона: temp 0,8, topk 40, topp 0,95, minp 0,05, restartpenalty 1.1. Это одна из лучших моделей 7B с точки зрения обучения следованию и способности рассуждать, и ее можно использовать для разговоров, ролевых игр и рассказывания историй. Обратите внимание, что он, как правило, имеет довольно формальный и изысканный стиль, но он…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: mlabonne
Теги: mistral, merge, lazymergekit, dpo, rlhf, conversational, en, model-index
Лайков: 148 | Загрузок: 13,380
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.