Это контрольная точка SFT, использованная в проекте. Документ RLHFlow/Online-RLHF: Рабочий процесс RLHF: From Reward Modeling to Online RLHF (опубликовано в TMLR, 2024 г.) Авторы: Ханцзэ Донг, Вэй Сюн, Бо Пан, Хаосян Ван, Хань Чжао, Инбо Чжоу, Нань Цзян, Дойен Саху, Цаймин Сюн, Тонг Чжан Код**: https://github.com/RLHFlow/Online-RLHF Модель обучена из мета-llama/Meta-Llama-3-8B на смеси разнообразных высококачественных данных из открытого источника за 1 эпоху с подробными параметрами в отчете. Он не проходил обучение в RLHF и может служить хорошей отправной точкой для исследований RLHF. Мы используем сценарий ToRA для оценки GSM8K и MATH, Evalplut для HumanEval и lm-evaluation-harness для других тестов. Модель оценивается в режиме нулевого выстрела, поэтому результаты здесь могут немного отличаться от тех, которые указаны в техническом отчете. Если вы считаете, что наша модель полезна для вашего исследования или продукта, процитируйте наш технический отчет.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: RLHFlow
Теги: llama, conversational, text-generation-inference, endpoints_compatible
Лайков: 10 | Загрузок: 30
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.