Это объединенная модель для LoRA https://huggingface.co/Yhyu13/phi-2-sft-dpo-gpt4_en-ep1-lora. Эта модель представляет собой усовершенствованную версию базовой модели https://huggingface.co/Yhyu13/phi-2-sft-alpacagpt4en-ep1, которая достигает лучших результатов, чем text-davinci-003 на AlpcaEval по оценке ChatGPT. Цитата из этого обсуждения https://huggingface.co/microsoft/phi-2/discussions/38 Поскольку phi2 требует удаленного кода, который таблица лидеров HF open llm не принимает в данный момент, вот результат, оцененныйchatpgpt https://github.com/tatsu-lab/alpaca_eval/pull/183 phi-2-alpaca-gpt4-dpo лишь немного лучше, чем мой предыдущий sft phi-2-alpaca-gpt4, при оценке с помощьюchatgpt, но настроенная модель dpo выдает значительно более длинный результат!
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Yhyu13
Теги: phi-msft, custom_code, endpoints_compatible
Лайков: 8 | Загрузок: 15
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.