RLHFlow/pair-preference-model-LLaMA3-8B - Каталог нейросетей
Генерация текста

RLHFlow/pair-preference-model-LLaMA3-8B

Добавлено:
RLHFlow/pair-preference-model-LLaMA3-8B

Документ: Рабочий процесс RLHF: от моделирования вознаграждения до онлайн-RLHF (опубликовано в TMLR, 2024 г.) Авторы: Ханцзэ Донг, Вэй Сюн, Бо Пан, Хаосян Ван, Хань Чжао, Инбо Чжоу, Нань Цзян, Дойен Саху, Цайминг Сюн, Тонг Чжан Код**: https://github.com/RLHFlow/RLHF-Reward-Modeling/ Это предпочтение Модель обучается на LLaMA3-8B-е с помощью обучающего скрипта Reward Modeling. Набор данных — RLHFlow/pairpreferencemodel_dataset. Он достигает 98,6 по разговорности, 65,8 по обаянию, 89,6 по безопасности и 94,9 по рассуждению на скамейке наград. Вот пример использования модели предпочтений для ранжирования пары. Для n>2 ответов рекомендуется использовать стратегию ранжирования в турнирном стиле, чтобы получить лучший ответ, чтобы сложность была линейной по n. Если вы используете эту модель в своем исследовании, пожалуйста, рассмотрите возможность цитирования нашей статьи и статьи Google Slic (которая изначально предлагает эту модель парных предпочтений).

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: RLHFlow
Теги: llama, conversational, text-generation-inference, endpoints_compatible
Лайков: 38  |  Загрузок: 86

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.