Оптимизация предпочтений самостоятельного воспроизведения для согласования языковой модели (https://arxiv.org/abs/2405.00675) Эта модель была разработана с использованием оптимизации предпочтений самостоятельного воспроизведения на итерации 3 на основе архитектуры mistralai/Mistral-7B-Instruct-v0.2 в качестве отправной точки. Мы использовали наборы подсказок из набора данных openbmb/UltraFeedback, разделенные на 3 части для 3 итераций с помощью snorkelai/Snorkel-Mistral-PairRM-DPO-Dataset. Все использованные ответы являются синтетическими. Это модель, описанная в статье, с K = 5 (генерация 5 ответов на итерацию). Мы приложили результаты оценки Arena-Hard на этой странице модели. — Mistral7B-PairRM-SPPO-Iter1 — Mistral7B-PairRM-SPPO-Iter2 — Mistral7B-PairRM-SPPO-Iter3 — Mistral7B-PairRM-SPPO — Тип модели: модель GPT с параметрами 7B, точно настроенная на синтетических наборах данных. — Язык(и) (NLP): Преимущественно английский — Лицензия: Apache-2.0 — Доработано на основе модели: mistralai/Mistral-7B-Instruct-v0.2 Модель | Оценка | 95% ДИ | средний # Токены | Мистраль7Б-ПараРМ-СППО-Итер3| 23,3 | (-1,8, 1,8)|578| — скорость обучения: 5e-07 — eta: 1000 — размер пакета поезда на устройство: 8 — шаги градиента накопления: 1 — начальное число: 42 — распределенный тип: deepspeedzero3 — число устройств: 8 — оптимизатор: RMSProp — lrschedulertype:…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: UCLA-AGI
Теги: mistral, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 8,247
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.