Это вознаграждение с контролируемым процессом (PRM), обученное на данных, сгенерированных Mistral из проекта RLHFlow/RLHF-Reward-Modeling. Модель обучена из мета-ламы/Llama-3.1-8B-Instruct на RLHFlow/Mistral-PRM-Data за 1 эпоху. Мы используем глобальный размер пакета 32 и скорость обучения 2e-6, где мы упаковываем образцы и разделяем их на фрагменты по 8192 токена. Дополнительные сведения об обучении см. на странице https://github.com/RLHFlow/Online-RLHF/blob/main/math/llama-3.1-prm.yaml. Подробные примеры см. на https://github.com/RLHFlow/RLHF-Reward-Modeling/tree/main/math-rm. Автоматическая аннотация была предложена в статье Math-Shepherd: Если вы найдете рецепт обучения полезным, процитируйте его следующим образом.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: RLHFlow
Теги: llama, conversational, text-generation-inference, endpoints_compatible
Лайков: 10 | Загрузок: 120
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.