Ling-3.0-flash-HybridQuant-NVFP4-W4A16-LocalHessian
A second quantization of inclusionAI/Ling-3.0-flash, alongside Ling-3.0-flash-HybridQuant-NVFP4-W4A16. Identical bit placement and identical serving contract; it differs in how...
A second quantization of inclusionAI/Ling-3.0-flash, alongside Ling-3.0-flash-HybridQuant-NVFP4-W4A16. Identical bit placement and identical serving contract; it differs in how...
4-bit GPTQ (W4A16) quantization of deepseek-ai/DeepSeek-V4-Flash-0731, produced with GPTQModel. This is the V1 release (first calibration run). A...
4-bit weight-only quantization (W4A16) of DavidAU’s 40B «Chimera» — the 6-Core Fable Fusion Heretic Uncensored model. Quantized with...
A W4A16-quantized DSpark speculator for zai-org/GLM-5.2-FP8, tuned for memory-bandwidth-bound hardware — specifically a two-node NVIDIA DGX Spark (GB10)...
Массы квантуют до INT4 (размер группы 128); активации выполняют в BF16. Результатом является контрольная точка объемом 388 ГБ...
NVFP4 (NVIDIA FP4, weight-only NVFP4A16) quantization of empero-ai/Qwythos-9B-Claude-Mythos-5-1M — a Claude-Mythos/Fable-trace reasoning fine-tune of Qwen3.5-9B (qwen35: a dense...
W4A16 (INT4 weights, BF16 activations) quantized version of OpenMOSE/Qwen3.5-REAP-262B-A17B, created using AutoRound. — Calibration dataset: NeelNanda/pile-10k (64 samples,...
> Выпущено 16 июля 2026 г. Все этапы пройдены: проверка артефакта (—check-mtp), > качество по сравнению с FP8...
4-битное (AWQ W4A16, только для экспертов) квантование MiMo-V2.5, упакованное для работы на NVIDIA A100 (SM80) под стандартной версией...
В этом репозитории представлены квантованные сборки zai-org/GLM-4.7 (модель Mixture-of-Experts), переупакованные для vLLM с использованием формата сжатых тензоров. >...