This is the SFT checkpoint used for the project RLHFlow/Online-RLHF Paper: RLHF Workflow: From Reward Modeling to Online RLHF (Published in TMLR, 2024) Authors: Hanze Dong, Wei Xiong, Bo Pang, Haoxiang Wang, Han Zhao, Yingbo Zhou, Nan Jiang, Doyen Sahoo, Caiming Xiong, Tong Zhang Code**: https://github.com/RLHFlow/Online-RLHF The model is trained from meta-llama/Meta-Llama-3-8B on RLHFlow/RLHFlow-SFT-Dataset-ver2 for 2 epochs. We use a global batch size of 128 and a learning rate of 2e-5, where we pack the samples and split them into chunks of 8192 token. See more training details at https://github.com/RLHFlow/Online-RLHF/blob/main/sft/llama3-8b-it.yaml . We use ToRA script to evaluate GSM8K and MATH, Evalplut for HumanEval, and lm-evaluation-harness for other benchmarks. The model is evaluated in zero-shot setting. Please cite our techical report if you find our model is useful for your research or product.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: RLHFlow
Теги: llama, conversational, text-generation-inference, endpoints_compatible
Лайков: 3 | Загрузок: 557
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.