Метка: rl - Страница 2 - Каталог нейросетей

Метка: rl

Генерация текста

philschmid/qwen-2.5-3b-r1-countdown

Эта модель представляет собой доработанную версию Qwen/Qwen2.5-3B-Instruct. Он был обучен с использованием TRL и GRPO в игре Countdown....

Генерация текста

prithivMLmods/Blitzar-Coder-4B-F.1

> Blitzar-Coder-4B-F.1 — это высокоэффективная многоязычная модель кодирования, настроенная на Qwen3-4B с использованием более крупных наборов данных трассировок...

Генерация текста

nvidia/Nemotron-Cascade-8B-Intermediate-ckpts

В этом репозитории публикуются промежуточные контрольные точки, созданные во время разработки Nemotron-Cascade-8B. Nemotron-Cascade-8B — это модель общего назначения,...

Генерация текста

bigatuna/Qwen3.5-27b-Sushi-Coder-RL-GGUF

Это старший брат bigatuna/Qwen3.5-9b-Sushi-Coder-RL-GGUF, созданный по тому же общему рецепту, но в масштабе 27B. 1. Запустите 16-разрядную базовую...

Генерация текста

mlx-community/Nemotron-Cascade-2-30B-A3B-4bit

Эта модель mlx-community/Nemotron-Cascade-2-30B-A3B-4bit была конвертирована в формат MLX из nvidia/Nemotron-Cascade-2-30B-A3B с использованием mlx-lm версии 0.31.2. Модальности:Генерация текста Области...

Генерация текста

bigatuna/Qwen3.5-9b-Sushi-Coder-RL-GGUF

— Родословная базовой модели: bigatuna/Qwen3.5-9b-Sushi-Coder — Модель RL: bigatuna/Qwen3.5-9b-Sushi-Coder-RL — Конвейер RL: NousResearch/atropos — nohurry/Opus-4.6-Reasoning-3000x-filtered — open-r1/codeforces-cots Затем...

Генерация текста

nvidia/Nemotron-Cascade-8B-Thinking

Мы рады представить Nemotron-Cascade-8B-Thinking, мощную модель общего назначения, обученную посредством последовательного и предметного обучения с подкреплением. Nemotron-Cascade-8B-Thinking проходит...