Ling-3.0-flash-NVFP4
includeAI/Ling-3.0-flash, квантованный до NVFP4 в формате сжатых тензоров, для vLLM и TensorRT-LLM. 76,9 ГБ по 16 шардам. Сборки...
includeAI/Ling-3.0-flash, квантованный до NVFP4 в формате сжатых тензоров, для vLLM и TensorRT-LLM. 76,9 ГБ по 16 шардам. Сборки...
> Выпущено 16 июля 2026 г. Все этапы пройдены: проверка артефакта (—check-mtp), > качество по сравнению с FP8...
> 4-битное квантование MXFP4 tencent/Hy3. > Оригинальная карта модели полностью сохранена ниже. Квант MXFP4 только по весу, создаваемый...
4-битное квантование MXFP4 Ornith-1.0-397B, созданное с помощью qstream. Только перенаправленные эксперты MoE (~95% весов) квантуются в MXFP4; все,...
Nex-N2-mini с квантованием NVFP4 (тонкая настройка Qwen3.5-MoE-35B), оптимизированная для NVIDIA Blackwell (SM 12.1), обслуживающая через vLLM с ядрами...
4-битное (AWQ W4A16, только для экспертов) квантование MiMo-V2.5, упакованное для работы на NVIDIA A100 (SM80) под стандартной версией...
Первое подтвержденное развертывание Qwen3.5-122B-A10B с точностью NVFP4 на одном NVIDIA Jetson AGX Thor (унифицированная память 128 ГБ). В...
Терминатор — это легкий нейронный модуль, который предсказывает, когда модель языка рассуждений достигнет окончательного ответа во время генерации...
Вы можете использовать gpt-oss-120b и gpt-oss-20b с трансформерами. Если вы используете шаблон чата Трансформеры, он автоматически применит формат...
Это квантование NVFP4 смешанной точности zai-org/GLM-4.7-Flash, модель Mixture-of-Experts 30B-A3B (30B всего, 3B активно). Эта версия сохраняет уровни MTP...