r0b0tlab/nex-n2-mini-nvfp4 - Каталог нейросетей
Генерация текста

r0b0tlab/nex-n2-mini-nvfp4

Добавлено:
r0b0tlab/nex-n2-mini-nvfp4

Nex-N2-mini с квантованием NVFP4 (тонкая настройка Qwen3.5-MoE-35B), оптимизированная для NVIDIA Blackwell (SM 12.1), обслуживающая через vLLM с ядрами FlashInfer CUTLASS. Сжатие 3,2× (70 ГБ BF16 → 22,1 ГБ NVFP4) с нулевой потерей качества при тестировании возможностей. Самый простой способ реализовать эту модель — автоматическая загрузка при первом запуске: полную документацию, переменные среды и AGENTS.md см. в репозитории GitHub. — Метод: NVFP4 через NVIDIA ModelOpt 0.44.0 — Область применения: только MLP (экспертные прогнозы + общий эксперт) — Размер группы: 16 — Калибровка: 128 выборок из CNN/DailyMail — Кэш KV: FP8 e4m3 с послойной калибровкой шкал — Экспертная калибровка: 10 240/10 240 (100%) Входит в контрольную точку: — Квантованные веса MoE NVFP4 (256 экспертов × 40 слоев) — Веса внимания BF16 (selfattn, linearattn) — Веса кодировщика изображения BF16 — BF16 lm_head.weight — Калиброванные шкалы кэша KV FP8 (k: 0,016–0,038, v: 0,010–0,040, q: 0,043) Протестировано на NVIDIA GB10 (Blackwell SM 12.1), vLLM v0.22.0, FlashInfer CUTLASS NVFP4. Декодирование стабильно на скорости 32–33 т/с на всех глубинах контекста (0–16 КБ). Деградация всего 2,8%. Масштабирование 6,5× на C8. КПД 8,42 т/с/Вт. Пиковая мощность 23,3 Вт при 48°C. Математика (3/3), Рассуждение (3/3), Программирование (3/3), Знания (2/2),…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: r0b0tlab
Теги: vllm, qwen3_5_moe, nvfp4, moe, quantized, blackwell, nvidia, modelopt
Лайков: 5  |  Загрузок: 1,192

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.