FairyR1-32B, высокоэффективная модель большого языка (LLM), которая соответствует или превосходит более крупные модели в некоторых задачах, несмотря на использование только ~ 5% их параметров. Построенный на основе DeepSeek-R1-Distill-Qwen-32B, FairyR1-32B использует новый конвейер «перегонки и слияния», сочетающий в себе точную настройку, ориентированную на задачи, с методами слияния моделей для обеспечения конкурентоспособной производительности при значительно уменьшенном размере и стоимости вывода. Этот проект финансировался NSFC, грант 624B2005. Модель FairyR1 представляет собой дальнейшее исследование нашей более ранней работы TinyR1, сохраняя основной подход «перегонки ветвей и слияний», но внося усовершенствования в обработку данных и архитектуру модели. В ходе этой работы мы пересмотрели конвейер обработки данных: необработанные примеры из таких наборов данных, как AIMO/NuminaMath-1.5 для математики и OpenThoughts-114k для кода, сначала проходили через несколько моделей «учителей» для генерации ответов кандидатов. Затем эти кандидаты были тщательно отобраны, реструктурированы и уточнены, особенно для цепочки мыслей (ЦП). Впоследствии мы применили многоступенчатую фильтрацию, включая автоматическую проверку правильности математических задач и выбор на основе длины (токены 2–8 тыс. для математических образцов,…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: PKU-DS-LAB
Теги: qwen2, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 102 | Загрузок: 24
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.