trl-lib/Qwen2-0.5B-DPO - Каталог нейросетей
Генерация текста

trl-lib/Qwen2-0.5B-DPO

Добавлено:
trl-lib/Qwen2-0.5B-DPO

Эта модель представляет собой доработанную версию Qwen/Qwen2-0.5B-Instruct для набора данных trl-lib/Capybara-Preferences. Он был обучен с использованием TRL. Эта модель была обучена с помощью DPO, метода, представленного в разделе «Прямая оптимизация предпочтений: ваша языковая модель тайно является моделью вознаграждения». — TRL: 0.12.0.dev0 — Трансформеры: 4.45.0.dev0 — Pytorch: 2.4.1 — Наборы данных: 3.0.0 — Токенизаторы: 0.19.1

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: trl-lib
Теги: qwen2, generated_from_trainer, trl, dpo, conversational, text-generation-inference, endpoints_compatible
Лайков: 4  |  Загрузок: 63

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.