gemma-3-1b-it-reasoning-grpo-lora
This LoRA adapter enhances google/gemma-3-1b-it with structured reasoning capabilities using tags. Trained with GRPO (Group Relative Policy Optimization)...
This LoRA adapter enhances google/gemma-3-1b-it with structured reasoning capabilities using tags. Trained with GRPO (Group Relative Policy Optimization)...
Этот адаптер LoRA расширяет возможности мета-ламы/Llama-3.2-1B-Instruct возможностями вызова инструментов для исследования кода и манипулирования им. Обучался с использованием...
Этот адаптер LoRA помогает восстановить точность при использовании квантованных версий Qwen/Qwen3-0.6B INT4. Он был обучен с использованием самодистилляции...
Этот адаптер LoRA добавляет в Qwen/Qwen3-4B-Thinking-2507 возможности осведомленности о выполнении. Вдохновленный исследованием Meta CWM (Code World Model), он...