Насколько нам известно, Light-R1-7B-DS представляет собой современную математическую модель 7B с открытым исходным кодом с оценками AIME24 и 25 59,1 и 44,3. Light-R1-7B-DS также хорошо показал себя на GPQA без какой-либо специальной подготовки. Созданный на базе DeepSeek-R1-Distill-Qwen-7B, Light-R1-7B-DS дополнительно обучается только с использованием данных SFT 3K, которые мы выложили в открытый доступ, что демонстрирует высокую применимость опубликованных данных. Мы рады представить эту модель вместе с техническим отчетом. Мы тщательно оценили загрязнение данных нескольких наборов данных с открытым исходным кодом. Хотя определенное загрязнение может быть неизбежным во время предварительного обучения, после обучения недопустимо сравнивать результаты с контрольными показателями. MATH-500 несколько усложнен десятками одинаковых вопросов или измененными только числами. AIME 24 и 25 остаются нетронутыми, но мы должны уделять особое внимание при включении данных AIME до 2023 года. Light-R1 провел тщательную дезактивацию с точным соответствием (за исключением цифр) и совпадением N-грамм (N = 32).
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: qihoo360
Теги: qwen2, conversational, text-generation-inference, endpoints_compatible
Лайков: 22 | Загрузок: 22
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.