Phoenix — это модель, обученная с использованием оптимизации прямых предпочтений (DPO) для немецкого языка. Процедура его обучения соответствует процессу руководства по выравниванию от Huggingface. В отличие от зефира и нотуса, эта модель была обучена с использованием немецких инструкций и данных dpo. Более подробно, немецкий перевод HuggingFaceH4/ultrachat200k и HuggingFaceH4/ultrafeedbackbinarized был создан в дополнение к серии уже доступных наборов данных инструкций. Для этого использовался LLM haoranxu/ALMA-13B. Хотя модель Mistral работает очень хорошо, она не совсем подходит для немецкого языка. Поэтому мы использовали фантастический LeoLM/leo-mistral-hessianai-7b. Благодаря новому типу тренировок Phoenix не только способен конкурировать с моделью Mistral от LeoLM, но и побеждает модель Llama-70b-chat в категории 2 м. жим. Эта модель была бы невозможна без потрясающей работы Huggingface, LeoLM, openbnb, argilla, Alma-Team и многих других представителей сообщества искусственного интеллекта. Я хотел бы лично поблагодарить всех исследователей искусственного интеллекта, которые делают возможным обучение таких моделей. Phoenix превосходит модель LeoLM-Mistral во всех категориях, кроме кодирования и гуманитарных наук.…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: DRXD1000
Теги: mistral, dpo, alignment-handbook, conversational, de, text-generation-inference, endpoints_compatible
Лайков: 17 | Загрузок: 29
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.