Эта модель представляет собой доработанную версию Qwen/Qwen2-72B-Instruct на 1,5 тыс. рядов mlabonne/orpo-dpo-mix-40k. Он был обучен как универсальная языковая модель для различных вариантов использования генерации текста, включая поддержку агентских возможностей, ролевые игры, рассуждения, многоходовые разговоры, согласованность длительного контекста и многое другое. Спасибо Млабонн, Квен и др. для исходного набора данных и базовой модели.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: dfurman
Теги: qwen2, orpo, rlhf, sft, conversational, en, model-index, text-generation-inference
Лайков: 4 | Загрузок: 26
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.