Qwen3.5-397B-A17B-NVFP4 — это квантованная NVFP4 версия Qwen/Qwen3.5-397B-A17B, модели языка видения «Смесь экспертов» с 397 параметрами, 17 B активных параметров, 512 экспертов на уровень (10 активных) и гибридное внимание (softmax + линейное/DeltaNet). Исходные веса BF16 были квантованы до NVFP4 (4 бита с блочной шкалой FP8 на 16 элементов) с помощью NVIDIA Model Optimizer v0.37.0. Только маршрутизируемые уровни экспертного MLP MoE (проекции ворот, вверх и вниз) квантуются в NVFP4. Следующие элементы остаются неквантованными в BF16: — Общие экспертные MLP (обрабатывают каждый токен, в отличие от маршрутизируемых экспертов. Спасибо Festr за указание на это) — Уровни внимания (softmax внимание и линейное внимание DeltaNet) — Кодер Vision (ViT) — Веса маршрутизатора/шлюза — Черновая модель MTP (многотокеновое предсказание) — Внедрения, нормы слоев, lmhead** Поскольку экспертные веса составляют подавляющее большинство параметров 397B, это по-прежнему дает значительную экономию памяти (~ 233 ГБ на диске). При калибровке используется естественная маршрутизация top-k, а не принудительная активация всех экспертов, поэтому шкалы квантования каждого эксперта отражают распределение токенов, которое он фактически видит во время вывода. Чтобы компенсировать это, калибровка была проведена на…
Модальности:
Генерация текста Компьютерное зрение Мультимодальность
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: lukealonso
Теги: qwen3_5_moe, qwen3.5, moe, quantized, nvfp4, fp4, multimodal, vision
Лайков: 9 | Загрузок: 9,342
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.