Trinity-Mini-DrugProt-Think
Trinity-Mini-DrugProt-Think RLVR (GRPO) + LoRA после обучения на Arcee Trinity Mini для классификации отношений DrugProt. 📝 Отчет | ...
Trinity-Mini-DrugProt-Think RLVR (GRPO) + LoRA после обучения на Arcee Trinity Mini для классификации отношений DrugProt. 📝 Отчет | ...
Эта карточка модели будет обновляться практически ежедневно, пока мы в ближайшее время не загрузим версию модели с защитными...
SIRI: Масштабирование итеративного обучения с подкреплением с помощью чередующегося сжатия — чередующееся сжатие–расширение: — Фаза сжатия: обеспечивает краткость...
Модель контрольной точки ARPO выпущена для бумажной оптимизации агентной усиленной политики. Масштабное обучение с подкреплением и проверяемыми вознаграждениями...
Исходная модель: https://huggingface.co/THU-KEG/LongWriter-Zero-32B. Запускайте их напрямую с помощью llama.cpp или любого другого проекта на основе llama.cpp. Некоторые из...
Квантованные выпуски GGUF Gwimi-4-12B-IT, модели инструкций Gemma 4 12B, прошедших пост-обучение с помощью: 1. Контролируемой точной настройки (SFT)...
Модель генерации текста Модальности:Генерация текста Области применения:Диалог / чат Задача: Генерация текста Автор: twnlp Теги: qwen3, chinese, text-correction,...
AREaL-SEA-235B-A22B — это многоходовой интерактивный агент, использующий инструменты, доработанный на основе Qwen3-235B-A22B-Thinking-2507 с использованием SFT + обучение с...
hkust-nlp/drkernel-14b — это модель на основе Qwen3-14B, предназначенная для генерации и оптимизации ядра графического процессора (особенно Triton) в...
ATLAS-8B-Thinking — это специализированная модель преподавателя, разработанная Arc Intelligence и предназначенная для решения основной проблемы надежности при обучении...