Метка: vllm - Каталог нейросетей

Метка: vllm

Генерация текста

canada-quant/hy3-w4a16-mtp

> Выпущено 16 июля 2026 г. Все этапы пройдены: проверка артефакта (—check-mtp), > качество по сравнению с FP8...

Генерация текста

olka-fi/Hy3-MXFP4

> 4-битное квантование MXFP4 tencent/Hy3. > Оригинальная карта модели полностью сохранена ниже. Квант MXFP4 только по весу, создаваемый...

Генерация текста

olka-fi/Ornith-1.0-397B-MXFP4

4-битное квантование MXFP4 Ornith-1.0-397B, созданное с помощью qstream. Только перенаправленные эксперты MoE (~95% весов) квантуются в MXFP4; все,...

Генерация текста

r0b0tlab/nex-n2-mini-nvfp4

Nex-N2-mini с квантованием NVFP4 (тонкая настройка Qwen3.5-MoE-35B), оптимизированная для NVIDIA Blackwell (SM 12.1), обслуживающая через vLLM с ядрами...

Генерация текста

spectator2026/MiMo-V2.5-AWQ-int4

4-битное (AWQ W4A16, только для экспертов) квантование MiMo-V2.5, упакованное для работы на NVIDIA A100 (SM80) под стандартной версией...

Генерация текста

acnagle/Terminator-Qwen3-8B

Терминатор — это легкий нейронный модуль, который предсказывает, когда модель языка рассуждений достигнет окончательного ответа во время генерации...

Генерация текста

MuXodious/gpt-oss-20b-RichardErkhov-heresy-GGUF

Вы можете использовать gpt-oss-120b и gpt-oss-20b с трансформерами. Если вы используете шаблон чата Трансформеры, он автоматически применит формат...

Генерация текста

GadflyII/GLM-4.7-Flash-MTP-NVFP4

Это квантование NVFP4 смешанной точности zai-org/GLM-4.7-Flash, модель Mixture-of-Experts 30B-A3B (30B всего, 3B активно). Эта версия сохраняет уровни MTP...