Мы предлагаем новую стратегию для улучшения оптимизации предпочтений вне политики путем моделирования обучения в соответствии с политикой с данными о предпочтениях вне политики. Наш метод взвешенной оптимизации предпочтений (WPO) адаптирует данные, не соответствующие политике, чтобы они больше напоминали данные, соответствующие политике, путем переоценки пар предпочтений в соответствии с их вероятностью в соответствии с текущей политикой. Этот метод не только решает проблему разрыва в распределении, но и улучшает процесс оптимизации без дополнительных затрат. Подробности можно найти в нашем препринте и репозитории. gemma-2-9b-it настроен гибридным WPO с использованием двух типов данных: 1. Выборочные выходные данные gemma в соответствии с политикой на основе подсказок Ultrafeedback. 2. Выходы GPT-4-turbo на основе подсказок Ultrafeedback. По сравнению с методом построения данных о предпочтениях, описанным в нашей статье, мы переключаемся на RLHFlow/ArmoRM-Llama3-8B-v0.1 для оценки выходных данных и выбираем выходные данные с максимальными/минимальными оценками для формирования пары предпочтений. Мы предоставляем данные о наших тренировках на сайте wzhouad/gemma-2-ultrafeedback-hybrid. — Скорость обучения: 1e-06 — Бета: 0,01 — Perdevicetrainbatchsize: 1 — Gradientaccumulationsteps: 16 — Начальное число: 1 — numdevices: 8 — Optim: adamwtorch — lrschedulertype: cosine — lrschedulerwarmupratio: 0,1…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: wzhouad
Теги: gemma2, alignment-handbook, gemma, conversational, text-generation-inference, endpoints_compatible
Лайков: 34 | Загрузок: 12
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.