Эта работа дополняет наш предыдущий отчет HiPO: Оптимизация гибридной политики для динамического рассуждения в магистратуре, где мы впервые представили парадигму AutoThink для управляемого рассуждения. В то время как KAT-V1 обрисовал общую структуру SFT + RL для адаптивного мышления, в этой статье представлен подробный алгоритмический дизайн этого рецепта обучения. Мы представляем HiPO (гибридная оптимизация политики для динамического рассуждения в LLM), новую структуру RL, разработанную для того, чтобы модели могли решать, когда «думать» (т. е. «размышлять»), а когда пропускать рассуждения (т. е. «обдумывать»), тем самым обеспечивая баланс между правильностью и эффективностью. — Гибридный конвейер данных. Собирает как обдуманные, так и обдуманные ответы, классифицирует запросы по сложности и использует надежную модель (например, DeepSeek-V3) для создания объяснений, обосновывающих выбор режима. — Гибридная система вознаграждений – объединяет вознаграждения за оба режима с регулировкой смещения, чтобы предотвратить чрезмерное использование длинных рассуждений, и функциями преимуществ с учетом режима, чтобы согласовать решения с повышением производительности. Только размышление (переосмысление). Обучение только на аналитических данных приводит к тому, что модель учитывает все проблемы, что приводит к неэффективности. ГРПО. Улучшает точность на +3,1%, но увеличивает жетон…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Kwaipilot
Теги: qwen3, conversational, text-generation-inference, endpoints_compatible
Лайков: 8 | Загрузок: 9
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.