Прямая оптимизация предпочтений Qwen настроена примерно на 3 эпохи.* Точная настройка предпочтений qwen2.5 нацелена на быстрое соблюдение правил, написание историй и ролевую игру. Другие квантовые репозитории также существуют на HuggingFace, и их можно найти. Обучил Qwen2.5-14B-Instruct для двух эпох на NVidia A100 и наборе данных jondurbin/gutenberg-dpo-v0.1, сохраняя по пути разные контрольные точки (совершенно разные прогоны в разные эпохи и скорости обучения). Танлибой обучал Qwen2.5-14B-Instruct в течение 1 эпохи на HuggingFaceH4/ultrafeedbackbinarized (Спасибо Tanliboy! Посмотрите модель здесь*) Объединена массовая контрольная точка, на основе Qwen2.5-14B-Instruct (базовая модель). Объединено с градиентом SLERP софосимпатии «Ultrafeedback-Binarized DPO» и «Gutenberg DPO» * Объединено с градиентом SLERP софоссимпатии «Qwen2.5-14B-Instruct» и «Gutenberg DPO» * Объединено все контрольные точки DPO и варианты SLERP с MODELSTOCK для анализа геометрических свойств и получения наиболее эффективных аспектов из всех работает/сливается. Модель Stock была выбрана из-за сходства объединенных моделей. Это было выбрано из-за того, что оценка ORPO* неясна, поэтому трудно определить, какие прогоны являются лучшими. Температура 1,3 [1], мин. давление 0,012…
Модальности:
Генерация текста
Области применения:
Следование инструкциям Диалог / чат
Задача: Генерация текста
Автор: v000000
Теги: qwen2, qwen, qwen2.5, finetune, dpo, orpo, chat, conversational
Лайков: 21 | Загрузок: 152
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.