> Нейронный DPO OpenHermes 2.5, для DPO важно высокое качество! Эта модель является виртуальным партнером по запуску нашего нового открытого набора данных argilla/distilabel-intel-orca-dpo-pairs. Это доработка DPO OpenHermes-2.5-Mistral-7B. Он превосходит потрясающий mlabonne/NeuralHermes-2.5-Mistral-7B с точно таким же рецептом DPO, но с использованием нашего нового набора данных о парах косаток. Набор данных представляет собой «дистиллированную» версию широко используемого набора данных: Intel/orcadpopairs. Исходный набор данных использовался сотнями практиков и моделей с открытым исходным кодом. Благодаря исправлению UltraFeedback (а до этого — Alpacas и Dollys) мы знали, что этот набор данных можно значительно улучшить. Продолжая нашу миссию по созданию лучших наборов данных по выравниванию для LLM с открытым исходным кодом и сообщества, мы потратили несколько часов на их улучшение с помощью distilabel. Основная интуиция заключалась в следующем: исходный набор данных просто предполагает, что gpt4/3.5-turbo всегда является лучшим ответом. Благодаря UltraFeedback мы знаем, что это не всегда так. Более того, точная настройка DPO выигрывает от разнообразия пар предпочтений. Вот что потребовалось для создания реального набора данных о предпочтениях с помощью distilabel: результирующий набор данных теперь гораздо полезнее: мы знаем, какой ответ предпочтителен (по…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: argilla
Теги: mistral, distilabel, dpo, rlaif, rlhf, conversational, en, text-generation-inference
Лайков: 34 | Загрузок: 36
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.