RLHFlow/LLaMA3-SFT-v2 - Каталог нейросетей
Генерация текста

RLHFlow/LLaMA3-SFT-v2

Добавлено:
RLHFlow/LLaMA3-SFT-v2

This is the SFT checkpoint used for the project RLHFlow/Online-RLHF Paper: RLHF Workflow: From Reward Modeling to Online RLHF (Published in TMLR, 2024) Authors: Hanze Dong, Wei Xiong, Bo Pang, Haoxiang Wang, Han Zhao, Yingbo Zhou, Nan Jiang, Doyen Sahoo, Caiming Xiong, Tong Zhang Code**: https://github.com/RLHFlow/Online-RLHF The model is trained from meta-llama/Meta-Llama-3-8B on RLHFlow/RLHFlow-SFT-Dataset-ver2 for 2 epochs. We use a global batch size of 128 and a learning rate of 2e-5, where we pack the samples and split them into chunks of 8192 token. See more training details at https://github.com/RLHFlow/Online-RLHF/blob/main/sft/llama3-8b-it.yaml . We use ToRA script to evaluate GSM8K and MATH, Evalplut for HumanEval, and lm-evaluation-harness for other benchmarks. The model is evaluated in zero-shot setting. Please cite our techical report if you find our model is useful for your research or product.

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: RLHFlow
Теги: llama, conversational, text-generation-inference, endpoints_compatible
Лайков: 3  |  Загрузок: 557

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.