Reasoning Llama model series fine-tuned on microsoft/orca-math-word-problems-200k using GRPO(Group Relative Policy Optimization) reinforcement learning technique. — learningrate = 5e-6, — adambeta1 = 0.9, — adambeta2 = 0.99, — weightdecay = 0.1, — warmupratio = 0.1, — lrschedulertype = «cosine», — optim = «pagedadamw_8bit»,
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: suayptalha
Теги: llama, unsloth, trl, grpo, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 3 | Загрузок: 20
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.