NeuralDaredevil-7B — это тонкая настройка DPO для mlabonne/Daredevil-7B с использованием набора данных предпочтений argilla/distilabel-intel-orca-dpo-pairs и моего блокнота DPO из этой статьи. Спасибо Аргилле за предоставленный здесь набор данных и рецепт обучения. 💪 Оценка проводилась с помощью LLM AutoEval в пакете Nous. Вы можете найти полный тест на YALL — Еще одна таблица лидеров LLM. В этой модели используется тот же шаблон подсказки, что и в mistralai/Mistral-7B-Instruct-v0.2.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: mlabonne
Теги: mistral, merge, mergekit, lazymergekit, dpo, rlhf, mlabonne/example, conversational
Лайков: 41 | Загрузок: 44
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.