Эта модель представляет собой доработанную версию Lambent/arsenic-nemo-unleashed-12B для [[‘nbeerbower/gutenberg-moderne-dpo’, ‘nbeerbower/Purpura-DPO’, ‘nbeerbower/Arkhaios-DPO’, ‘xinlai/Math-Step-DPO-10K’, ‘Lambent/rp-teacher-synth-dpo’, ‘nbeerbower/gutenberg2-dpo’, ‘openvoid/darkside-dpo’]](https://huggingface.co/datasets/[‘nbeerbower/gutenberg-moderne-dpo’, ‘nbeerbower/Purpura-DPO’, ‘nbeerbower/Arkhaios-DPO’, ‘xinlai/Math-Step-DPO-10K’, ‘Lambent/rp-teacher-synth-dpo’, ‘nbeerbower/gutenberg2-dpo’, ‘openvoid/darkside-dpo’]). Он был обучен с использованием TRL. Эта модель была обучена с помощью DPO, метода, представленного в разделе «Прямая оптимизация предпочтений: ваша языковая модель тайно является моделью вознаграждения». — TRL: 0.12.1 — Трансформеры: 4.47.0 — Pytorch: 2.3.1+cu121 — Наборы данных: 3.1.0 — Токенизаторы: 0.21.0
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Lambent
Теги: mistral, generated_from_trainer, not-for-all-audiences, conversational, text-generation-inference, endpoints_compatible
Лайков: 13 | Загрузок: 6
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.