Мы предлагаем новую стратегию для улучшения оптимизации предпочтений вне политики путем моделирования обучения в соответствии с политикой с данными о предпочтениях вне политики. Наш метод взвешенной оптимизации предпочтений (WPO) адаптирует данные, не соответствующие политике, чтобы они больше напоминали данные, соответствующие политике, путем переоценки пар предпочтений в соответствии с их вероятностью в соответствии с текущей политикой. Этот метод не только решает проблему разрыва в распределении, но и улучшает процесс оптимизации без дополнительных затрат. Подробности можно найти в нашем препринте и репозитории. Модель Llama3-Instruct-8B, настроенная гибридным WPO, с использованием трех типов данных: 1. Набор данных ультраобратной связи. 2. Выборочные результаты Llama в соответствии с политикой на основе подсказок Ultrafeedback. 3. Выходы GPT-4-turbo на основе подсказок Ultrafeedback. По сравнению с методом построения данных о предпочтениях, описанным в нашей статье, он использует метод: 1. Использует ответ с минимальным баллом в качестве отклоненного. 2. Если несколько выходных данных имеют одинаковый наивысший балл, выбирается тот, у которого наименьшая длина. 3. Если несколько выходных данных имеют одинаковый минимальный балл, выбирается тот, длина которого наименьшая по сравнению с выбранным выходным сигналом. Модель обучена на основе…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: wzhouad
Теги: llama, alignment-handbook, conversational, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 6
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.