qwen-2.5-3b-r1-countdown
Эта модель представляет собой доработанную версию Qwen/Qwen2.5-3B-Instruct. Он был обучен с использованием TRL и GRPO в игре Countdown....
Эта модель представляет собой доработанную версию Qwen/Qwen2.5-3B-Instruct. Он был обучен с использованием TRL и GRPO в игре Countdown....
> Blitzar-Coder-4B-F.1 — это высокоэффективная многоязычная модель кодирования, настроенная на Qwen3-4B с использованием более крупных наборов данных трассировок...
В этом репозитории публикуются промежуточные контрольные точки, созданные во время разработки Nemotron-Cascade-8B. Nemotron-Cascade-8B — это модель общего назначения,...
Специалист по прогнозированию финансовых фундаментальных показателей DeepHermes — Atropos RL — это экспериментальная модель артефакта, доработанная Nous Research...
Это старший брат bigatuna/Qwen3.5-9b-Sushi-Coder-RL-GGUF, созданный по тому же общему рецепту, но в масштабе 27B. 1. Запустите 16-разрядную базовую...
Эта модель mlx-community/Nemotron-Cascade-2-30B-A3B-4bit была конвертирована в формат MLX из nvidia/Nemotron-Cascade-2-30B-A3B с использованием mlx-lm версии 0.31.2. Модальности:Генерация текста Области...
Это копия DeepSeek R1 для задач преобразования текста в график. Он основан на модели Qwen-2.5-0.5B и обучен с...
Исходная модель: https://huggingface.co/nvidia/Nemotron-Cascade-2-30B-A3B — llama.cpp — LM Studio — koboldcpp — Jan AI — Веб-интерфейс создания текста —...
— Родословная базовой модели: bigatuna/Qwen3.5-9b-Sushi-Coder — Модель RL: bigatuna/Qwen3.5-9b-Sushi-Coder-RL — Конвейер RL: NousResearch/atropos — nohurry/Opus-4.6-Reasoning-3000x-filtered — open-r1/codeforces-cots Затем...
Мы рады представить Nemotron-Cascade-8B-Thinking, мощную модель общего назначения, обученную посредством последовательного и предметного обучения с подкреплением. Nemotron-Cascade-8B-Thinking проходит...