Мы обучили google/gemma-2b с помощью DPO и данных из argilla/dpo-mix-7k. Мы тщательно выбрали гиперпараметры для достижения наилучшей производительности DPO. – Тип модели: модель, подобная GPT, с параметрами 2,5 млрд., точно настроенная на основе общедоступных синтетических наборов данных. — Язык(и) (NLP): преимущественно английский. — Лицензия: Условия использования Gemma. — Точная настройка на основе модели: google/gemma-2b. Эта модель имеет ту же лицензию, что и исходная коллекция моделей Gemma.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Columbia-NLP
Теги: gemma, alignment-handbook, trl, dpo, generated_from_trainer, conversational, model-index, text-generation-inference
Лайков: 4 | Загрузок: 11
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.