Эта модель представляет собой доработанную версию Qwen/Qwen2-0.5B-Instruct для набора данных trl-lib/Capybara-Preferences. Он был обучен с использованием TRL. Эта модель была обучена с помощью DPO, метода, представленного в разделе «Прямая оптимизация предпочтений: ваша языковая модель тайно является моделью вознаграждения». — TRL: 0.12.0.dev0 — Трансформеры: 4.45.0.dev0 — Pytorch: 2.4.1 — Наборы данных: 3.0.0 — Токенизаторы: 0.19.1
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: trl-lib
Теги: qwen2, generated_from_trainer, trl, dpo, conversational, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 63
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.