Вместо обучения дополнительной модели вознаграждения, которая, скорее всего, будет использоваться в играх, мы непосредственно обучаем модель в социальных играх! 🕹️ 🎲 🎮 Тренировался со стабильным выравниванием на 8xA100 в течение 3 часов. Начальной контрольной точкой является модель hh-rlhf-sft. Мы также выпустили улучшенную базовую модель, которая является отправной точкой SFT. Хотя этот проект направлен на лучшее согласование существующих LM с социальными нормами, несоответствующее содержание и присущие предвзятости в данных обучения по-прежнему будут ухудшать согласованность модели. Модель не следует использовать непосредственно в каком-либо приложении без предварительной оценки проблем безопасности и справедливости, характерных для данного приложения. Пожалуйста, цитируйте нашу статью, если вы используете данные или код в этом репозитории:
Модальности:
Генерация текста
Задача: Генерация текста
Автор: agi-css
Теги: llama, rlhf, alignment, simulation, computational social science, en, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 10
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.