TIGER-Lab/General-Reasoner-Qwen2.5-14B - Каталог нейросетей
Генерация текста

TIGER-Lab/General-Reasoner-Qwen2.5-14B

Добавлено:
TIGER-Lab/General-Reasoner-Qwen2.5-14B

Рисунок: Эффективность метода общего рассуждения, обученного с помощью различных поддающихся проверке вопросов рассуждения с использованием верификатора на основе модели, по сравнению с базовыми методами при решении различных задач рассуждения. General-Reasoner — это парадигма обучения работе с большими языковыми моделями (LLM), предназначенная для значительного улучшения способностей к рассуждению в различных областях — не только в математике и программировании, но также в физике, химии, финансах, гуманитарных науках и многом другом. Ключевые особенности: — Обучение с нулевым RL: прямое обучение с подкреплением на основе базовых LLM, минуя промежуточные контролируемые этапы. — Разнообразные данные для рассуждений: более 230 тысяч высококачественных проверяемых вопросов, взятых из Интернета и отфильтрованных для проверки проверяемости ответов по различным дисциплинам. — Верификатор на основе модели: компактная генеративная модель верификатора размером 1,5 Б для контекстно-зависимой проверки ответов по цепочке мыслей, превосходящая традиционные методы, основанные на правилах. Эта конкретная модель представляет собой вариант General-Reasoner, обученный на основе Qwen2.5-14B-Base. General-Reasoner превосходит базовые и контролируемые модели по ряду тестов рассуждения, демонстрируя надежное обобщение по областям:

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: TIGER-Lab
Теги: qwen2, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 5  |  Загрузок: 10

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.