Вместо обучения дополнительной модели вознаграждения, которая, скорее всего, будет использоваться в играх, мы непосредственно обучаем модель в социальных играх! 🕹️ 🎲 🎮 Это самое начало проекта Stable Alignment, который представляет собой расширенную модель настройки инструкций на основе LLaMA. — Инструкция по настройке качества данных с помощью AlpacaDataCleaned, которая исправляет множество ошибок в исходном наборе данных Alpaca. Хотя этот проект направлен на лучшее согласование существующих LM с социальными нормами, несоответствующее содержание и присущие предвзятости в данных обучения по-прежнему будут ухудшать согласованность модели. Модель не следует использовать непосредственно в каком-либо приложении без предварительной оценки проблем безопасности и справедливости, характерных для данного приложения. Пожалуйста, цитируйте нашу статью, если вы используете данные или код в этом репозитории:
Модальности:
Генерация текста
Задача: Генерация текста
Автор: agi-css
Теги: llama, rlhf, alignment, simulation, computational social science, en, text-generation-inference, endpoints_compatible
Лайков: 6 | Загрузок: 14
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.