justinj92/Qwen2.5-1.5B-Thinking - Каталог нейросетей
Генерация текста

justinj92/Qwen2.5-1.5B-Thinking

Добавлено:
justinj92/Qwen2.5-1.5B-Thinking

Улучшенная модель на Qwen2.5-1.5B-Thinking-v1.1. Он был обучен с использованием TRL. Эта модель была обучена с помощью GRPO, метода, представленного в DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. Рекомендуется придерживаться следующих конфигураций при использовании моделей, включая бенчмаркинг, для достижения ожидаемой производительности: 1. Установите температуру в диапазоне 0,5-0,7 (рекомендуется 0,6), чтобы предотвратить бесконечные повторения или бессвязные выходы. 2. Для математических задач рекомендуется включить в подсказку такую директиву, как: «Пожалуйста, рассуждайте шаг за шагом и поместите свой окончательный ответ в boxed{}». 3. При оценке эффективности модели рекомендуется проводить несколько тестов и усреднять результаты. 4. Эта модель не улучшена для других областей, кроме математики. — TRL: 0.15.0.dev0 — Трансформаторы: 4.49.0.dev0 — Питорч: 2.5.1 — Наборы данных: 3.2.0 — Токенизаторы: 0.21.0

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: justinj92
Теги: qwen2, generated_from_trainer, trl, grpo, conversational, zho, eng, fra
Лайков: 4  |  Загрузок: 29

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.