Эта модель, обученная GRPO, представляет собой точно настроенную версию deepseek-ai/DeepSeek-R1-Distill-Qwen-7B в наборе данных DigitalLearningGmbH/MATH-lighteval. GRPO применяется после создания дистиллированной модели R1 для дальнейшего уточнения ее возможностей рассуждения. Вместо начального этапа перегонки, который передает мощности из более крупной модели, GRPO использует обучение с подкреплением для оптимизации модели политики путем максимизации сигнала вознаграждения. Этот шаг тонкой настройки отличается от дистилляции и направлен на повышение производительности в задачах цепочки мыслей и рассуждений. Особая благодарность Dongwei за доработку этой версии DeepSeek-R1-Distill-Qwen-7B. Более подробную информацию можно найти здесь: https://huggingface.co/Dongwei/DeepSeek-R1-Distill-Qwen-7B-GRPO_Math — Конвертирован в формат MLX с квантованием 8 бит для лучшей производительности на Apple Silicon Mac. — Если вам нужна меньшая (квантованная) модель, см. Модели ниже. — Кажется, прочесывает «мыслительный» процесс и сразу же начинает отвечать, что приводит к чрезвычайно быстрым, но правильным ответам. Модель AlejandroOlmedo/DeepSeek-R1-Distill-Qwen-7B-GRPOMath-8bit-mlx была преобразована в формат MLX из Dongwei/DeepSeek-R1-Distill-Qwen-7B-GRPOMath с использованием…
Модальности:
Генерация текста
Области применения:
Диалог / чат Логика и рассуждение Математика
Задача: Генерация текста
Автор: AlejandroOlmedo
Теги: qwen2, generated_from_trainer, open-r1, trl, grpo, mlx, mlx-my-repo, conversational
Лайков: 3 | Загрузок: 271
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.