Метка: reinforcement-learning - Каталог нейросетей

Метка: reinforcement-learning

Генерация текста

ross-dev/Quantum-Consciousness-LLM

Эта карточка модели будет обновляться практически ежедневно, пока мы в ближайшее время не загрузим версию модели с защитными...

Генерация текста

THU-KEG/SIRI-7B-high

SIRI: Масштабирование итеративного обучения с подкреплением с помощью чередующегося сжатия — чередующееся сжатие–расширение: — Фаза сжатия: обеспечивает краткость...

Генерация текста

dongguanting/Qwen3-14B-ARPO-DeepSearch

Модель контрольной точки ARPO выпущена для бумажной оптимизации агентной усиленной политики. Масштабное обучение с подкреплением и проверяемыми вознаграждениями...

Генерация текста

bartowski/THU-KEG_LongWriter-Zero-32B-GGUF

Исходная модель: https://huggingface.co/THU-KEG/LongWriter-Zero-32B. Запускайте их напрямую с помощью llama.cpp или любого другого проекта на основе llama.cpp. Некоторые из...

Генерация текста

trjxter/Gwimi-4-12B-IT-GGUF

Квантованные выпуски GGUF Gwimi-4-12B-IT, модели инструкций Gemma 4 12B, прошедших пост-обучение с помощью: 1. Контролируемой точной настройки (SFT)...

Генерация текста

twnlp/ChineseErrorCorrector4-4B

Модель генерации текста Модальности:Генерация текста Области применения:Диалог / чат Задача: Генерация текста Автор: twnlp Теги: qwen3, chinese, text-correction,...

Генерация текста

inclusionAI/AReaL-SEA-235B-A22B

AREaL-SEA-235B-A22B — это многоходовой интерактивный агент, использующий инструменты, доработанный на основе Qwen3-235B-A22B-Thinking-2507 с использованием SFT + обучение с...

Генерация текста

hkust-nlp/drkernel-14b

hkust-nlp/drkernel-14b — это модель на основе Qwen3-14B, предназначенная для генерации и оптимизации ядра графического процессора (особенно Triton) в...

Генерация текста

Arc-Intelligence/ATLAS-8B-Thinking

ATLAS-8B-Thinking — это специализированная модель преподавателя, разработанная Arc Intelligence и предназначенная для решения основной проблемы надежности при обучении...