m51Lab-MiniMax-M2.7-REAP-139B-A10B-NVFP4-GB10
What happened: The initial upload (2026-04-15) used ignore=[«lmhead»] in the llm-compressor recipe, which meant the 62 MoE routers...
What happened: The initial upload (2026-04-15) used ignore=[«lmhead»] in the llm-compressor recipe, which meant the 62 MoE routers...
Trinity-Large-Thinking is a reasoning-optimized variant of Arcee AI’s Trinity-Large family — a 398B-parameter sparse Mixture-of-Experts (MoE) model with...
NVFP4-quantized version of Qwen/Qwen2.5-72B-Instruct, produced by Enfuse. — Full NVFP4 (W4A4): Requires NVIDIA Blackwell GPU (B200, GB200, RTX...
Этот репозиторий содержит Behemoth-X-123B-v2, квантованный с помощью NVFP4, 4-разрядного сжатия, подходящего для максимальной производительности на графических процессорах серии...
Этот репозиторий содержит Seed-OSS-36B-Instruct, квантованный с помощью NVFP4, подходящий для максимальной производительности на оборудовании Nvidia Blackwell (5070, 5080,...
includeAI/Ling-3.0-flash, квантованный до NVFP4 в формате сжатых тензоров, для vLLM и TensorRT-LLM. 76,9 ГБ по 16 шардам. Сборки...
Всего 117,6 млрд параметров, около 8,5 млрд активных на токен и до 262 144 контекстов токенов на 32...
NVFP4 (родной Blackwell FP4) ГГУФ Qwen3.6-27B (плотный). Однофайловое квантование на основе FP4, которое выполняется на серверной части LocalAI...
Этот репозиторий содержит 4-битную квантованную сборку Jiunsong/SuperQwen-AgentWorld-35B-A3B, удаленную. Номера тестов и подробности проверки см. в родительском репозитории BF16....
Неофициальное преобразование NVFP4 MTP GGUF Mia-AiLab/Qwable-3.6-27b. Восходящая модель Qwable представляет собой усовершенствованную версию Qwen3.6 27B, ориентированную на выполнение...