Статья: Рабочий процесс RLHF: от моделирования вознаграждения до онлайн-RLHF (опубликовано в TMLR, 2024 г.) Авторы: Ханцзэ Донг, Вэй Сюн, Бо Пан, Хаосян Ван, Хан Чжао, Инбо Чжоу, Нань Цзян, Дойен Саху, Цайминг Сюн, Тонг Чжан Код**: https://github.com/RLHFlow/Online-RLHF Мы публикуем неофициальную контрольную точку современной модели обучения своего класса, LLaMA3-iterative-DPO-final. Во всех трех широко используемых тестах модели инструкций: Alpaca-Eval-V2, MT-Bench, Chat-Arena-Hard наша модель превосходит все модели аналогичного размера (например, LLaMA-3-8B-it), большинство крупных моделей с открытым исходным кодом (например, Mixtral-8x7B-it) и мощные собственные модели (например, GPT-3.5-turbo-0613). Модель обучается с использованием наборов данных с открытым исходным кодом без какой-либо дополнительной маркировки человеком/GPT4. Более того, мы предоставим подробный рецепт воспроизведения модели. Наслаждаться! См. коллекцию обучающего набора, модель вознаграждения/предпочтений, модель SFT. — Модель SFT. — Модель вознаграждения. Эта модель больше похожа на краткую версию отчета. Мы все еще работаем над выпуском модели из-за некоторых проблем с лицензией…. Мы разработали простой и эффективный онлайн-рецепт RLHF для обучения инструкторов LLM. Наш рецепт основан на ДПО и, следовательно, намного дешевле и…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: RLHFlow
Теги: llama, conversational, text-generation-inference, endpoints_compatible
Лайков: 41 | Загрузок: 97
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.