Satori-7B-Round2 — это LLM 7B, обученный на модели с открытым исходным кодом (Qwen-2.5-Math-7B) и данных с открытым исходным кодом (OpenMathInstruct-2 и NuminaMath). Сатори-7B-Раунд2 способен к авторегрессионному поиску, то есть к саморефлексии и самоисследованию без внешнего руководства. Это достигается с помощью предложенной нами цепочки действий-мысли (COAT) и двухэтапной парадигмы после обучения. Мы формулируем рассуждение LLM как последовательную задачу принятия решений, где рассуждение представляет собой процесс построения и уточнения ответа шаг за шагом. В частности, LLM (политика агента) начинается с входного контекста (начальное состояние), генерирует шаг рассуждения (действие) и обновляет контекст (следующее состояние). LLM повторяет этот процесс до тех пор, пока не достигнет окончательного ответа, и получает вознаграждение, которое оценивает, соответствует ли окончательный ответ основной истине. С помощью этой формулировки мы могли бы научить LLM рассуждать с использованием RL, стремясь сгенерировать последовательность шагов рассуждения, которые максимизируют ожидаемое вознаграждение. Ключевая задача достижения авторегрессионного поиска — позволить LLM определить, когда следует размышлять, продолжать или исследовать альтернативные решения без внешнего вмешательства. Для этого мы представляем…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Satori-reasoning
Теги: qwen2, conversational, text-generation-inference, endpoints_compatible
Лайков: 11 | Загрузок: 14
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.