Эта модель представляет собой доработанную версию deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B. Он был обучен с использованием TRL. Эта модель была обучена с помощью GRPO, метода, представленного в книге DeepSeekMath: расширение границ математического рассуждения в моделях открытого языка. — TRL: 0.24.0 — Трансформеры: 4.57.1 - Pytorch: 2.8.0+cu128 — Наборы данных: 4.2.0 — Токенизаторы: 0.22.1
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Thrillcrazyer
Теги: qwen2, generated_from_trainer, trl, grpo, conversational, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.