AlejandroOlmedo/DeepSeek-R1-Distill-Qwen-7B-GRPO_Math-8bit-mlx - Каталог нейросетей
Генерация текста

AlejandroOlmedo/DeepSeek-R1-Distill-Qwen-7B-GRPO_Math-8bit-mlx

Добавлено:
AlejandroOlmedo/DeepSeek-R1-Distill-Qwen-7B-GRPO_Math-8bit-mlx

Эта модель, обученная GRPO, представляет собой точно настроенную версию deepseek-ai/DeepSeek-R1-Distill-Qwen-7B в наборе данных DigitalLearningGmbH/MATH-lighteval. GRPO применяется после создания дистиллированной модели R1 для дальнейшего уточнения ее возможностей рассуждения. Вместо начального этапа перегонки, который передает мощности из более крупной модели, GRPO использует обучение с подкреплением для оптимизации модели политики путем максимизации сигнала вознаграждения. Этот шаг тонкой настройки отличается от дистилляции и направлен на повышение производительности в задачах цепочки мыслей и рассуждений. Особая благодарность Dongwei за доработку этой версии DeepSeek-R1-Distill-Qwen-7B. Более подробную информацию можно найти здесь: https://huggingface.co/Dongwei/DeepSeek-R1-Distill-Qwen-7B-GRPO_Math — Конвертирован в формат MLX с квантованием 8 бит для лучшей производительности на Apple Silicon Mac. — Если вам нужна меньшая (квантованная) модель, см. Модели ниже. — Кажется, прочесывает «мыслительный» процесс и сразу же начинает отвечать, что приводит к чрезвычайно быстрым, но правильным ответам. Модель AlejandroOlmedo/DeepSeek-R1-Distill-Qwen-7B-GRPOMath-8bit-mlx была преобразована в формат MLX из Dongwei/DeepSeek-R1-Distill-Qwen-7B-GRPOMath с использованием…

Модальности:
Генерация текста

Области применения:
Диалог / чат Логика и рассуждение Математика


Задача: Генерация текста
Автор: AlejandroOlmedo
Теги: qwen2, generated_from_trainer, open-r1, trl, grpo, mlx, mlx-my-repo, conversational
Лайков: 3  |  Загрузок: 271

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.