Мы выпускаем предварительную версию STILL-3-1.5B, медленно думающую модель рассуждения, которая достигает точности 39,33% в тесте AIME! Мы адаптируем обучение с подкреплением к модели 1.5B и наблюдаем постоянное улучшение производительности по мере увеличения количества этапов обучения. Чтобы лучше воспроизводить нашу работу и продвигать прогресс исследований, мы открываем исходный код нашего кода, модели и данных. Мы оценивали модель по четырем тестам: MATH, AIME, OMNI и LiveAOPS. Для MATH и AIME мы использовали установку декодирования выборки с температурой выборки 0,6 и вероятностью выборки top-p 0,95. Каждый вопрос был выбран 64 раза, и был рассчитан средний балл. Для OMNI и LiveAOPS (август–ноябрь 2024 г.) мы случайным образом выбирали подмножество ответов в виде целых чисел, чтобы облегчить автоматическую оценку, и использовали для оценки декодирование жадного поиска. Обученная модель STILL-3-1.5B-preview добилась значительного улучшения. Точность решения задачи AIME увеличилась с 28,67% до 39,33%, что привело к относительному улучшению на 37,18%. Пожалуйста, цитируйте наши отчеты, если они полезны для вашего исследования.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: RUC-AIBOX
Теги: qwen2, conversational, text-generation-inference, endpoints_compatible
Лайков: 10 | Загрузок: 59
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.