Языковая модель phi-1.5 представляет собой Transformer с 1,3 млрд параметров. Обучение проводилось с использованием тех же источников данных, что и phi-1, дополненных новым источником данных, который состоит из различных синтетических текстов НЛП. При сравнении с эталонами, проверяющими здравый смысл, понимание языка и логические рассуждения, phi-1.5 демонстрирует почти современную производительность среди моделей с менее чем 10 миллиардами параметров. Модель прошла процесс пост-обучения, который включает в себя как контролируемую точную настройку, так и оптимизацию прямых предпочтений для следования инструкциям. Я использовал библиотеку trl и один графический процессор A100 40 ГБ как на этапе SFT, так и на этапе DPO. — Supervised Fine-Tuning — SFT Model: phi-1_5-sft — Used 128,000 instruction, response pairs from the teknium/OpenHermes-2.5 dataset — Direct Preference Optimization (DPO) — LoRA Adapter: phi-15-dpo — Used a combination of the following preference datasets — HuggingFaceH4/ultrafeedbackbinarized — argilla/distilabel-intel-orca-dpo-pairs — argilla/distilabel-math-preference-dpo — jondurbin/py-dpo-v0.1 Given the nature of the training data, the Phi-1.5 Instruct model is best sui Ты можешь…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: rasyosef
Теги: phi, conversational, text-generation-inference, endpoints_compatible
Лайков: 3 | Загрузок: 387
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.