DeepThink-Phi4 представляет собой открытую модель, которая представляет собой настройку вознаграждения GRPO с использованием набора данных openai/gsm8k. Это улучшает способность рассуждения. phi-4 — это современная открытая модель, построенная на сочетании синтетических наборов данных, данных с отфильтрованных общедоступных веб-сайтов, а также приобретенных научных книг и наборов данных вопросов и ответов. Цель этого подхода заключалась в том, чтобы гарантировать, что небольшие способные модели обучались с использованием данных, ориентированных на высокое качество и расширенное мышление. phi-4 прошла строгий процесс улучшения и согласования, включающий как контролируемую точную настройку, так и прямую оптимизацию предпочтений для обеспечения точного соблюдения инструкций и надежных мер безопасности. Учитывая характер обучающих данных, phi-4 лучше всего подходит для подсказок в формате чата следующим образом: Как и другие языковые модели, phi-4 потенциально может вести себя несправедливо, ненадежно или оскорбительно. Некоторые из ограничивающих моделей поведения, о которых следует знать, включают: Качество обслуживания: модель обучается в основном на английском тексте. На других языках, кроме английского, производительность будет хуже. Разновидности английского языка, которые меньше представлены в данных обучения, могут иметь худшие результаты, чем стандартный американский английский. фи-4` это не…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: EpistemeAI
Теги: llama, text-generation-inference, unsloth, trl, conversational, en, endpoints_compatible
Лайков: 5 | Загрузок: 2
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.