knoveleng/OpenRS-GRPO - Каталог нейросетей
Генерация текста

knoveleng/OpenRS-GRPO

Добавлено:
knoveleng/OpenRS-GRPO

В этом репозитории размещена модель для проекта Open RS, сопровождающая документ «Обучение с подкреплением для рассуждения в небольших LLM: что работает, а что нет». Проект исследует улучшение возможностей рассуждения в небольших моделях большого языка (LLM) с использованием обучения с подкреплением (RL) в условиях ограниченных ресурсов. Мы ориентируемся на модель DeepSeek-R1-Distill-Qwen-1.5B с 1,5 миллиардами параметров, обученную на 4 графических процессорах NVIDIA A40 (по 48 ГБ видеопамяти каждый) в течение 24 часов. Адаптировав алгоритм групповой относительной политики оптимизации (GRPO) и используя тщательно подобранный компактный набор данных для математических рассуждений, мы провели три эксперимента для оценки производительности и поведения. Ключевые результаты включают в себя: — Значительные улучшения рассуждения, например, точность AMC23 выросла с 63% до 80%, а AIME24 достигла 46,7%, что превосходит o1-предварительного просмотра. — Эффективное обучение с использованием всего 7000 образцов по цене 42 доллара США по сравнению с тысячами долларов для базовых моделей. — Проблемы, такие как нестабильность оптимизации и ограничения длины при расширенном обучении. Эти результаты демонстрируют точную настройку на основе RL как экономически эффективный подход для небольших LLM, делающий возможности рассуждения доступными в условиях ограниченных ресурсов. Мы открываем исходный код…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: knoveleng
Теги: qwen2, conversational
Лайков: 5  |  Загрузок: 12

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.