Экспериментальная модель, выполняющая тренировку DPO поверх Kunoichi-DPO-v2-7b, то есть двойного DPO.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: crestf411
Теги: mistral, not-for-all-audiences, text-generation-inference, endpoints_compatible
Лайков: 15 | Загрузок: 7
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.