Квантованная версия MXFP4 Qwen3.5-122B-A10B (122B параметров, 256 экспертов, гибрид Gated DeltaNet + Gated Attention). Только экспертные веса MLP квантуются до MXFP4 (4-битное микромасштабирование с общими экспонентами e8m0, размер блока 32). Все внимание, линейное внимание (Gated DeltaNet), вентили, вложения и уровни нормализации остаются в BF16. — Архитектура: Qwen3.5 MoE — гибрид Gated DeltaNet + Gated Attention с 48 уровнями, 256 экспертов (8 маршрутизируемых + 1 общий активный на токен) — Параметры: всего 122 байт, ~10 байт активных на токен — Длина контекста: 262 144 токена — Словарь: 248 320 токенов — Формат: MXFP4 — 4-битное число с плавающей запятой (E2M1) с общая экспонента блока e8m0 на 32 элемента — Выбор масштаба: MSE-оптимальный для трех возможных экспонент на блок (не простое округление) — Масштабирование с учетом активации: отключено для этой модели — Qwen3.5 имеет отрицательные веса LayerNorm, которые нарушают гамма-прокси — Почти нулевая обработка: блоки с максимальным значением < 1e-6 обнуляются (Qwen3.5 имеет ~ 44% структурно разреженных экспертных строк) Минимальная видеопамять: ~114 ГБ (например, 2x A100-80 ГБ с TP=2 или 4x RTX Pro 6000 с TP=4). — Пользовательский инструмент квантования MXFP4 с MSE-оптимальным выбором шкалы из трех кандидатов. — Общая экспонента для каждого блока (32 элемента) в e8m0…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: olka-fi
Теги: qwen3_5_moe, image-text-to-text, mxfp4, quantized, vllm, compressed-tensors, moe, conversational
Лайков: 10 | Загрузок: 490
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.