Оптимизация предпочтений самостоятельного воспроизведения для согласования языковой модели (https://arxiv.org/abs/2405.00675) Эта модель была разработана с использованием оптимизации предпочтений самостоятельного воспроизведения на основе архитектуры mistralai/Mistral-7B-Instruct-v0.2 в качестве отправной точки. Мы использовали наборы подсказок из набора данных openbmb/UltraFeedback, разделенные на 3 части для 3 итераций с помощью snorkelai/Snorkel-Mistral-PairRM-DPO-Dataset. Все использованные ответы являются синтетическими. Пока K = 5, эта модель использует три выборки для оценки мягких вероятностей P(yw > yl) и P(yl > yw). Эти выборки включают победителя, проигравшего и еще одну случайную выборку. Этот подход показал лучшую производительность в AlpacaEval 2.0 по сравнению с результатами, представленными в нашей статье. ❗Пожалуйста, обратитесь к исходной контрольно-пропускной точке UCLA-AGI/Mistral7B-PairRM-SPPO-Iter3, как сообщается в нашей статье. Мы ожидаем, что версия, представленная в документе, продемонстрирует более последовательное улучшение производительности во всех задачах оценки. — Mistral7B-PairRM-SPPO-Iter1 — Mistral7B-PairRM-SPPO-Iter2 — Mistral7B-PairRM-SPPO-Iter3 — Mistral7B-PairRM-SPPO — Тип модели: модель GPT с параметрами 7B, точно настроенная на синтетических наборах данных. — Язык(и) (НЛП): Преимущественно английский -…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: UCLA-AGI
Теги: mistral, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 6 | Загрузок: 31
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.