notbdq/Qwen2.5-14B-Instruct-1M-GRPO-Reasoning - Каталог нейросетей
Генерация текста

notbdq/Qwen2.5-14B-Instruct-1M-GRPO-Reasoning

Добавлено:
notbdq/Qwen2.5-14B-Instruct-1M-GRPO-Reasoning

обучающий скрипт: https://gist.github.com/notlober/9bf4c3ab6ddeb12ec669ca495653708a код вывода: тесты: это определенно лучше, чем qwen 14B 1M, но я протестировал только 15 образцов набора проверки aime, и он работал лучше, чем qwen 2.5 1M с первого образца, но есть еще 75 образцов, поэтому я делюсь скриптом, чтобы кто-то мог протестировать его, если хочет: техника: GRPO применяется к qwen 14B 1M с текущими проблемами набора данных Numina COT: 1. бесконечная генерация при попадании в сложную задачу 2. увеличение длины последовательности при обучении

Модальности:
Генерация текста

Области применения:
Диалог / чат Следование инструкциям


Задача: Генерация текста
Автор: notbdq
Теги: qwen2, conversational, text-generation-inference, endpoints_compatible
Лайков: 4  |  Загрузок: 13

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.