Эта модель представляет собой доработанную версию Qwen/Qwen2.5-1.5B-Instruct. Он был обучен с использованием TRL. Эта модель была обучена с помощью GRPO, метода, представленного в книге DeepSeekMath: расширение границ математического рассуждения в моделях открытого языка. — TRL: 0.14.0 — Трансформеры: 4.48.1 — Pytorch: 2.5.1 — Наборы данных: 3.1.0 — Токенизаторы: 0.21.0 Репликация стратегии DeepSeek R1 на Qwen-2.5-1.5b на графических процессорах 8H100** Желаемый ввод: абзацы неструктурированного текста и пустые правила схемы. Вывод — заполненный созданный JSON из Неструктурированный текст после ссылки на набор данных правил пустой схемы для более подробного понимания — https://huggingface.co/datasets/MasterControlAIML/JSON-Unstructured-Structured
Модальности:
Генерация текста
Области применения:
Диалог / чат Логика и рассуждение
Задача: Генерация текста
Автор: MasterControlAIML
Теги: tensorboard, qwen2, generated_from_trainer, trl, grpo, deepseek, r1, conversational
Лайков: 5 | Загрузок: 27
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.