Это модель, опубликованная для нашей статьи: REBEL: Обучение с подкреплением через регрессию относительных вознаграждений. Эта модель разработана с помощью REBEL на основе Meta-Llama-3-8B-Instruct с FsfairX-LLaMA3-RM-v0.1 в качестве модели вознаграждения и набора данных UltraFeedback. Код обучения доступен по адресу https://github.com/ZhaolinGao/REBEL. Мы собираем онлайн-генерации во время каждой итерации с размером пакета 32. Пожалуйста, цитируйте нашу статью, если вы используете эту модель в своей работе:
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Cornell-AGI
Теги: llama, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 19
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.