phi-2-dpo — это настроенная по инструкциям модель из более ранней модели SFT phi-2-sft. Оптимизация прямых предпочтений (DPO) используется для точной настройки подмножества из 10 тыс. набора данных UltraFeedback. Цель эксперимента — понять качество предварительно обученной модели Фи-2. Хорошей новостью является то, что phi-2-dpo может хорошо следовать открытым инструкциям пользователя. Модель была доработана на 10-тысячном подмножестве бинаризованной версии UltraFeedback с DPO. Гиперпараметры: — скорость обучения: 3% линейного прогрева, с пиком 3e-5 и косинусным затуханием — эпохи: 2 — размер пакета: 64 — длина контекста: 1024 — бета-версия DPO: 0,1 * Генерация неточного кода и фактов: модель может выдавать неправильные фрагменты кода и операторы. Пользователи должны относиться к этим результатам как к предложениям или отправным точкам, а не как к окончательным или точным решениям. * Ограниченный объем кода: большая часть обучающих данных Phi-2 основана на Python и использует общие пакеты, такие как «печать, математика, случайные числа, коллекции, дата-время, itertools». Если модель генерирует сценарии Python, использующие другие пакеты или сценарии на других языках, мы настоятельно рекомендуем пользователям вручную проверять все использование API. * Ненадежная реакция на инструкции: Модель не…
Модальности:
Генерация текста
Области применения:
Генерация кода
Задача: Генерация текста
Автор: lxuechen
Теги: phi-msft, nlp, code, custom_code, en, model-index, endpoints_compatible
Лайков: 17 | Загрузок: 31
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.