Эта версия представляет собой RL с GRPO на GSM8k на 1400 шагов с использованием этого кода: Использование MGS и UNA (MLP) на этой крошечной, но мощной модели вместе с GRPO. Есть некоторый повышенный балл по GSM, GPQA и MUSR, но это происходит не на всех контрольных точках, и это тот, у которого самые высокие оценки. — Команда Deepseek за исследования GRPO — HuggingFace за внедрение GRPO в TRL — Команда Qwen за выдающуюся модель — Команда MagPie за предоставление множества наборов данных — Cybertron Cloud Compute
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: fblgit
Теги: qwen2, generated_from_trainer, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 11
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.