This LoRA adapter enhances google/gemma-3-1b-it with structured reasoning capabilities using tags. Trained with GRPO (Group Relative Policy Optimization) on self-generated preference data. — Structured Thinking: Teaches models to use tags for chain-of-thought reasoning — GRPO Training: Uses preference learning to optimize reasoning quality — Self-Generated Data: No external datasets required — uses Magpie approach — Multi-Domain: Effective across mathematics, logic, science, and problem-solving — Base Model: google/gemma-3-1b-it — Training Method: GRPO (Group Relative Policy Optimization) — LoRA Rank: 64 — LoRA Alpha: 128 — Training Samples: 107 — Thinking Tag
Модальности:
Генерация текста
Области применения:
Логика и рассуждение
Задача: Генерация текста
Автор: codelion
Теги: peft, ellora, lora, reasoning, chain-of-thought, grpo, thinking, preference-learning
Лайков: 4 | Загрузок: 2
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.