Метка: reinforcement-learning - Каталог нейросетей

Метка: reinforcement-learning

Генерация текста

Kwai-Klear/GoLongRL-4B

We present GoLongRL, a fully open-source, capability-oriented post-training recipe for long-context reinforcement learning with verifiable rewards (RLVR). Overall...

Генерация текста

hkust-nlp/drkernel-8b

hkust-nlp/drkernel-8b is a Qwen3-8B-based model specialized for GPU kernel generation and optimization (especially Triton) in the DR.Kernel framework....

Генерация текста

Maincode/Maincoder-1B-ONNX

Maincoder-1B-ONNX — это ONNX-оптимизированная версия Maincoder-1B, кодо-ориентированной языковой модели, оптимизированной для задач генерации и завершения кода. Эта версия...