Улучшенная модель на Qwen2.5-1.5B-Thinking-v1.1. Он был обучен с использованием TRL. Эта модель была обучена с помощью GRPO, метода, представленного в DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. Рекомендуется придерживаться следующих конфигураций при использовании моделей, включая бенчмаркинг, для достижения ожидаемой производительности: 1. Установите температуру в диапазоне 0,5-0,7 (рекомендуется 0,6), чтобы предотвратить бесконечные повторения или бессвязные выходы. 2. Для математических задач рекомендуется включить в подсказку такую директиву, как: «Пожалуйста, рассуждайте шаг за шагом и поместите свой окончательный ответ в boxed{}». 3. При оценке эффективности модели рекомендуется проводить несколько тестов и усреднять результаты. 4. Эта модель не улучшена для других областей, кроме математики. — TRL: 0.15.0.dev0 — Трансформаторы: 4.49.0.dev0 — Питорч: 2.5.1 — Наборы данных: 3.2.0 — Токенизаторы: 0.21.0
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: justinj92
Теги: qwen2, generated_from_trainer, trl, grpo, conversational, zho, eng, fra
Лайков: 4 | Загрузок: 29
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.