Ling-3.0-flash-NVFP4
includeAI/Ling-3.0-flash, квантованный до NVFP4 в формате сжатых тензоров, для vLLM и TensorRT-LLM. 76,9 ГБ по 16 шардам. Сборки...
includeAI/Ling-3.0-flash, квантованный до NVFP4 в формате сжатых тензоров, для vLLM и TensorRT-LLM. 76,9 ГБ по 16 шардам. Сборки...
> Выпущено 16 июля 2026 г. Все этапы пройдены: проверка артефакта (—check-mtp), > качество по сравнению с FP8...
> 4-битное квантование MXFP4 tencent/Hy3. > Оригинальная карта модели полностью сохранена ниже. Квант MXFP4 только по весу, создаваемый...
4-битное квантование MXFP4 Ornith-1.0-397B, созданное с помощью qstream. Только перенаправленные эксперты MoE (~95% весов) квантуются в MXFP4; все,...
Qwen3.5-122B-A10B оптимизирован для NVIDIA DGX Spark (GB10, SM12.1) — все квантования встроены. Эта контрольная точка получена из Sehyo/Qwen3.5-122B-A10B-NVFP4...
Что произошло: при первоначальной загрузке (15 апреля 2026 г.) в рецепте llm-compressor использовался ignore=[«lmhead»], что означало, что 62...
JoyAI-LLM-Flash — это современная модель языка инструкций среднего размера с 3 миллиардами активированных параметров и 48 миллиардами общих...
Для IQuest-Coder-V1-Instruct: мы предлагаем использовать Температура=0,6, TopP=0,85, TopK=20. IQuest-Coder-V1 — это новое семейство моделей большого языка кода (LLM),...
— Метод квантования: AWQ — Биты: 8 — Размер группы: 32 — Набор калибровочных данных: Princeton-nlp/SWE-benchVerified — Инструмент...
В этом репозитории представлены квантованные сборки zai-org/GLM-4.7 (модель Mixture-of-Experts), переупакованные для vLLM с использованием формата сжатых тензоров. >...