suayptalha/ThinkerLlama-8B-v1 - Каталог нейросетей
Генерация текста

suayptalha/ThinkerLlama-8B-v1

Добавлено:
suayptalha/ThinkerLlama-8B-v1

Reasoning Llama model series fine-tuned on microsoft/orca-math-word-problems-200k using GRPO(Group Relative Policy Optimization) reinforcement learning technique. — learningrate = 5e-6, — adambeta1 = 0.9, — adambeta2 = 0.99, — weightdecay = 0.1, — warmupratio = 0.1, — lrschedulertype = «cosine», — optim = «pagedadamw_8bit»,

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: suayptalha
Теги: llama, unsloth, trl, grpo, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 3  |  Загрузок: 20

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.