Это настроенная RL модель OpenHermes-2.5-Mistral-7B от Teknium с использованием наборов данных предпочтений Intel/orcadpopairs и argilla/ultrafeedback-binarized-preferences для обучения с подкреплением с использованием оптимизации прямых предпочтений (DPO). DPOpenHermes обучается с использованием qLoRA. Адаптер также представлен в репозитории этой модели. Опечатка: из-за проблемы, связанной с тем, что версия только для DPO не могла генерировать токен eos, эта модель была дополнительным SFT с 7000 строками из набора данных openhermes, чтобы научить модель снова использовать eostoken для завершения хода. Это привело к снижению контрольных оценок. Вы можете найти исходную модель только для DPO в ветке dpo-v0`. DPOpenHermes обучался на одном H100 объемом 80 ГБ, размещенном на RunPod, в течение примерно 10 часов для 0,6 эпохи набора данных. https://wandb.ai/oaaic/openhermes-dpo/reports/DPOpenHermes—Vmlldzo2MTQ3NDg2 DPOpenHermes использует ChatML в качестве формата подсказок, открывая гораздо более структурированную систему для вовлечения LLM в многоходовой диалог в чате. Системные подсказки теперь имеют значение! Гермес 2.5 был обучен использовать системные подсказки из командной строки для более активного выполнения инструкций, охватывающих множество ходов. Это более сложный формат, чем альпака или…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: openaccess-ai-collective
Теги: mistral, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 16 | Загрузок: 30
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.