Мы выпускаем современную модель своего класса Llama-3-8B-SFR-Iterative-DPO-R. Во всех трех широко используемых тестах модели инструкций: Alpaca-Eval-V2, MT-Bench, Chat-Arena-Hard наша модель превосходит все модели аналогичного размера (например, LLaMA-3-8B-it), большинство крупных моделей с открытым исходным кодом (например, Mixtral-8x7B-it) и мощные собственные модели (например, GPT-3.5-turbo-0613). Модель обучается с использованием наборов данных с открытым исходным кодом без какой-либо дополнительной маркировки человеком/GPT4. Мы разработали простой и эффективный онлайн-рецепт RLHF для обучения инструкторов LLM. Наш рецепт основан на DPO и, следовательно, намного дешевле и проще в обучении и настройке по сравнению с подходами на основе PPO. В отличие от широко используемого офлайнового DPO, онлайн-компонент нашего подхода эффективно смягчает сдвиги в распределении во время оптимизации политики. Подробную информацию можно найти в нашем сопроводительном техническом отчете. Llama-3-8B-SFR-Iterative-DPO-R — это исследовательская модель, разработанная в рамках нашей инициативы RLHF в Salesforce. Хотя соображения безопасности и этики являются неотъемлемой частью нашего процесса согласования, остается вероятность того, что модель может генерировать оскорбительный или неэтичный контент, особенно в состязательных условиях.…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Salesforce
Теги: llama, conversational, text-generation-inference, endpoints_compatible
Лайков: 78 | Загрузок: 38
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.