Рисунок: Эффективность метода общего рассуждения, обученного с помощью различных поддающихся проверке вопросов рассуждения с использованием верификатора на основе модели, по сравнению с базовыми методами при решении различных задач рассуждения. General-Reasoner — это парадигма обучения работе с большими языковыми моделями (LLM), предназначенная для значительного улучшения способностей к рассуждению в различных областях — не только в математике и программировании, но также в физике, химии, финансах, гуманитарных науках и многом другом. Ключевые особенности: — Обучение с нулевым RL: прямое обучение с подкреплением на основе базовых LLM, минуя промежуточные контролируемые этапы. — Разнообразные данные для рассуждений: более 230 тысяч высококачественных проверяемых вопросов, взятых из Интернета и отфильтрованных для проверки проверяемости ответов по различным дисциплинам. — Верификатор на основе модели: компактная генеративная модель верификатора размером 1,5 Б для контекстно-зависимой проверки ответов по цепочке мыслей, превосходящая традиционные методы, основанные на правилах. Эта конкретная модель представляет собой вариант General-Reasoner, обученный на основе Qwen2.5-14B-Base. General-Reasoner превосходит базовые и контролируемые модели по ряду тестов рассуждения, демонстрируя надежное обобщение по областям:
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: TIGER-Lab
Теги: qwen2, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 10
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.