Это первая итерация этой модели. В целях тестирования он просто обучался на 10 тысячах строк. Он показал себя очень хорошо, чем ожидалось. Сначала он делает рассуждения, а затем генерирует ответ на их основе, но это похоже на o1. Он делает рассуждения отдельно, без специальных жетонов или ответных рассуждений. Ниже приведен код вывода. — Обучил: Нишит Джейн — Лицензия: apache-2.0 — Точная настройка на основе модели: Qwen/Qwen2.5-0.5B-Instruct — Используемый набор данных: KingNish/reasoning-base-20k Эта модель qwen2 была обучена в 2 раза быстрее с помощью библиотеки TRL Unsloth и Huggingface.
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: KingNish
Теги: qwen2, text-generation-inference, unsloth, trl, sft, reasoning, conversational, zho
Лайков: 31 | Загрузок: 1,830
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.