m51Lab-MiniMax-M2.7-REAP-139B-A10B-NVFP4
Что произошло: при первоначальной загрузке (15 апреля 2026 г.) в рецепте llm-compressor использовался ignore=[«lmhead»], что означало, что 62...
Что произошло: при первоначальной загрузке (15 апреля 2026 г.) в рецепте llm-compressor использовался ignore=[«lmhead»], что означало, что 62...
редактировать: с vllm используйте —language-model-only , еще не разобрался с этим. Личный эксперимент по агрессивной обрезке МО. Цель:...
Первое подтвержденное развертывание Qwen3.5-122B-A10B с точностью NVFP4 на одном NVIDIA Jetson AGX Thor (унифицированная память 128 ГБ). В...
— Архитектура модели: openai/gpt-oss-20b (Mixture of Experts, контекст 128 КБ) — Параметры: 20 миллиардов (квантованные из исходного MXFP4...
Модель NVIDIA Kimi-K2.7-Code NVFP4 представляет собой квантованную версию модели Kimi-K2.7-Code компании Moonshot AI, которая представляет собой авторегрессионную языковую...
Квантование NVFP4 (4-битное) zai-org/GLM-5.2, созданное с помощью NVIDIA TensorRT Model Optimizer 0.44.0. Экспертные FFN MoE (маршрутизируемые + общие)...
Квантование LiquidAI/LFM2.5-8B-A1B NVFP4 (W4A4) — 8,3-битный / 1,5-активный процессор смешанных экспертов (контекст 131 КБ) работает на одном графическом...
Модель txn545/Qwen3.5-35B-A3B-NVFP4 представляет собой квантованную версию модели Qwen3.5-35B-A3B от Alibaba, авторегрессионной языковой модели, в которой используется оптимизированная архитектура...
— Архитектура модели: Meta-Llama-3.1 — Входные данные: текст/изображение — Выходные данные: текст — Оптимизация модели: — Весовое квантование:...
Модель NVIDIA DeepSeek R1 FP4 v2 — это квантованная версия модели DeepSeek R1 компании DeepSeek AI, которая представляет...