InfiX-ai/InfiAlign-Qwen-7B-DPO - Каталог нейросетей
Генерация текста

InfiX-ai/InfiAlign-Qwen-7B-DPO

Добавлено:
InfiX-ai/InfiAlign-Qwen-7B-DPO

InfiAlign — это масштабируемая и эффективная в отношении данных структура пост-обучения, которая сочетает в себе контролируемую точную настройку (SFT) и оптимизацию прямых предпочтений (DPO) с высококачественным конвейером выбора данных для улучшения рассуждений в больших языковых моделях. В основе InfiAlign лежит надежный конвейер выбора данных, который автоматически управляет высококачественными данными выравнивания из наборов данных рассуждений с открытым исходным кодом с использованием многомерных показателей качества. Этот конвейер обеспечивает значительный прирост производительности при резком снижении требований к данным и остается расширяемым для новых источников данных. При применении к модели Qwen2.5-Math-7B-Base наша модель SFT достигает производительности наравне с DeepSeek-R1-Distill-Qwen-7B, используя при этом только около 12% данных обучения, и демонстрирует сильное обобщение по различным задачам рассуждения. Дополнительные улучшения достигаются за счет применения оптимизации прямых предпочтений (DPO), причем особенно заметны успехи в задачах математического рассуждения. Модель достигает среднего улучшения на 3,89% по контрольным показателям AIME 24/25. Структура InfiAlign предлагает несколько вариантов, адаптированных к различным стратегиям выравнивания: InfiAlign-Qwen-7B-SFT:…

Модальности:
Генерация текста

Области применения:
Логика и рассуждение Диалог / чат


Задача: Генерация текста
Автор: InfiX-ai
Теги: qwen2, large-language-models, DPO, direct-preference-optimization, reasoning, long-CoT, conversational, en
Лайков: 4  |  Загрузок: 11

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.