Мы представляем Merlinite-7B-pt, мощную модель чата с открытым исходным кодом, предпочтения которой согласованы с использованием обратной связи ИИ без использования собственных моделей или каких-либо человеческих аннотаций. — Merlinite-7B-pt сначала подвергается контролируемой точной настройке (SFT) через LAB с использованием Mistral-7B-v0.1 в качестве базовой модели, а затем настраивается по предпочтениям с помощью обратной связи AI. — Наш рецепт настройки предпочтений использует вознаграждение DPO из Mixtral-8x7B-Instruct-v0.1 в качестве прокси для человеческих предпочтений и применяет итеративную выборку отклонения для точной настройки политики SFT. — Мы показываем, что лог-коэффициенты DPO могут служить надежным сигналом вознаграждения, демонстрируя четкую корреляцию между улучшениями вознаграждения и улучшениями MT-Bench. Официальный Merlinite-7B-pt достигает 7,96 на MT-Bench, превосходя Mistral-7B-Instruct-v0.1, Llama2-70b-chat и сравнимый с небольшими фирменными моделями, такими как GPT3.5-Turbo-0314 и Claude-v1. Он также демонстрирует превосходное выполнение инструкций и предпочтение человека по сравнению с моделью SFT Merlinite-7B. [*] Номера для моделей, отличных от Merlinite-7b, Merlinite-7b-pt и Labradorite-13b (наша), взяты из lmsys/chatbot-arena-leaderboard. [***] Модель Merlinite-7b-pt демонстрирует изменчивость при оценке MT-Bench. Средний балл за 5 раундов составляет 7,85, при этом…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: instructlab
Теги: mistral, merlinite-pt, merlinite, ibm, lab, labrador, labradorite, conversational
Лайков: 8 | Загрузок: 5
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.