Оптимизация предпочтений самостоятельного воспроизведения для согласования языковой модели (https://arxiv.org/abs/2405.00675) Эта модель была разработана с использованием оптимизации предпочтений самостоятельного воспроизведения на итерации 3 на основе архитектуры google/gemma-2-9b-it в качестве отправной точки. Мы использовали наборы подсказок из набора данных openbmb/UltraFeedback, разделенные на 3 части для 3 итераций с помощью snorkelai/Snorkel-Mistral-PairRM-DPO-Dataset. Все использованные ответы являются синтетическими. — Gemma-2-9B-It-SPPO-Iter1 — Gemma-2-9B-It-SPPO-Iter2 — Gemma-2-9B-It-SPPO-Iter3 — Тип модели: модель типа GPT с параметрами 8B, точно настроенная на синтетических наборах данных. — Язык(и) (NLP): Преимущественно английский — Лицензия: Apache-2.0 — Точная настройка на основе модели: google/gemma-2-9b-it — Скорость обучения: 5e-07 — Eta: 1000 — perdevicetrainbatchsize: 8 -gradientaccumulationsteps: 1 — начальное число: 42 — распределенный тип: deepspeedzero3 — количество устройств: 8 — оптимизатор: RMSProp — lrschedulertype: линейный — lrschedulerwarmupratio: 0,1 — numtrain_epochs: 1,0
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: UCLA-AGI
Теги: gemma2, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 127 | Загрузок: 2,687
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.