SIRI: Масштабирование итеративного обучения с подкреплением с помощью чередующегося сжатия — чередующееся сжатие–расширение: — Фаза сжатия: обеспечивает краткость и высокую плотность рассуждений за счет ограничения длины развертывания. — Фаза расширения: восстанавливает более длительные развертывания, чтобы стимулировать исследование и планирование. — Эффективность токена без потери точности: в отличие от предыдущих методов, SIRI повышает точность, одновременно сокращая среднее использование токена. — Итеративное обучение RL: построено на GRPO с модификациями DAPO (развязка клип-высокого/низкого уровня, удаление KL). — Обобщение по размерам моделей: проверено на моделях 1.5B и 7B.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: THU-KEG
Теги: qwen2, reinforcement-learning, conversational, en, zh, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 13
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.