codelion/gemma-3-1b-it-reasoning-grpo-lora - Каталог нейросетей
Генерация текста

codelion/gemma-3-1b-it-reasoning-grpo-lora

Добавлено:
codelion/gemma-3-1b-it-reasoning-grpo-lora

This LoRA adapter enhances google/gemma-3-1b-it with structured reasoning capabilities using tags. Trained with GRPO (Group Relative Policy Optimization) on self-generated preference data. — Structured Thinking: Teaches models to use tags for chain-of-thought reasoning — GRPO Training: Uses preference learning to optimize reasoning quality — Self-Generated Data: No external datasets required — uses Magpie approach — Multi-Domain: Effective across mathematics, logic, science, and problem-solving — Base Model: google/gemma-3-1b-it — Training Method: GRPO (Group Relative Policy Optimization) — LoRA Rank: 64 — LoRA Alpha: 128 — Training Samples: 107 — Thinking Tag

Модальности:
Генерация текста

Области применения:
Логика и рассуждение


Задача: Генерация текста
Автор: codelion
Теги: peft, ellora, lora, reasoning, chain-of-thought, grpo, thinking, preference-learning
Лайков: 4  |  Загрузок: 2

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.