Эта модель представляет собой LLaDA-8B-Instruct, настроенную с помощью JustGRPO на GSM8K. Он был представлен в статье «Ловушка гибкости: почему произвольный порядок ограничивает потенциал рассуждения в моделях диффузного языка». JustGRPO — это минималистский подход RL для диффузных языковых моделей. Вместо сложных RL-адаптаций, специфичных для диффузии, мы просто рассматриваем dLLM как авторегрессионные модели во время обучения и применяем стандартные GRPO. Подробности смотрите в нашей статье. — Страница проекта: https://nzl-thu.github.io/the-flexibility-trap — Документ: arXiv:2601.15165 — Код: https://github.com/LeapLabTHU/JustGRPO Для создания и оценки обратитесь к нашему репозиторию GitHub.
Модальности:
Генерация текста
Области применения:
Математика Логика и рассуждение Следование инструкциям
Задача: Генерация текста
Автор: nzl-thu
Теги: llada, image-feature-extraction, reasoning, math, diffusion-language-model, custom_code
Лайков: 8 | Загрузок: 71
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.