SciJudge-4B-2605 — это модель Qwen3-4B-Instruct-2507, специально настроенная для оценки научных статей. Учитывая названия, аннотации и даты публикации двух статей, он предсказывает, какая статья имеет более высокий уровень цитирования. Этот выпуск является частью проекта AI Can Learn Scientific Taste. Сопутствующая более крупная модель — SciJudge-30B-2605, а набор эталонных данных — SciJudgeBench. — Базовая модель: Qwen/Qwen3-4B-Instruct-2507 — Метод обучения: GRPO с потерей DAPO — Награда: вознаграждение за внешние предпочтения за парное суждение на основе цитирования — Данные обучения: 720 341 пара предпочтений из SciJudgeBench — Точность: bfloat16 — Коэффициент KL: 0,03 Точность разделения теста SciJudgeBench, пример из 1000 примеров MAIN_1000 внутридоменный оценочный набор:
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: OpenMOSS-Team
Теги: qwen3, scientific-taste, GRPO, conversational, en, model-index, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 188
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.