Zigeng/R1-VeriThinker-7B - Каталог нейросетей
Генерация текста

Zigeng/R1-VeriThinker-7B

Добавлено:
Zigeng/R1-VeriThinker-7B

🔍 VeriThinker: обучение верификации повышает эффективность модели рассуждения > VeriThinker: обучение верификации повышает эффективность модели рассуждения > Зиген Чен, Синьинь Ма, Гунфан Фанг, Жуонань Ю, Синьчао Ван > Лаборатория xML, Национальный университет Сингапура Ключевое различие между VeriThinker и традиционными методами SFT или RL, основанными на длинном и коротком,. Мы уникально обучаем LRM решению вспомогательной задачи проверки CoT, достигая эффективного сжатия CoT, не полагаясь на синтетические целевые цепочки рассуждений. 💻 Репозитарий кода GitHub 📄 Бумага ArXiv-Link 🤖 Модель R1-VeriThinker-7B 📊 Data CoT-Veirification-340k 📄 Бумага (🤗) Hugging Face Paper Мы представляем VeriThinker, новый подход к сжатию CoT. В отличие от традиционных методов, которые настраивают LRM непосредственно на исходную задачу рассуждения с использованием синтетических кратких данных CoT, мы инновационно настраиваем модель исключительно посредством вспомогательной задачи проверки. Обучая LRM точной проверке правильности решений ЦТ, LRM по своей сути становятся более проницательными в отношении необходимости последующих шагов саморефлексии, тем самым эффективно подавляя чрезмерное обдумывание. Обширные эксперименты подтверждают, что VeriThinker существенно сокращает цепочку рассуждений…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: Zigeng
Теги: qwen2, conversational, text-generation-inference, endpoints_compatible
Лайков: 5  |  Загрузок: 22

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.