DeepSeek V4 Flash с сокращением REAP на уровне K128 (128 маршрутизируемых экспертов на каждый уровень MoE, сокращение 50%) с гибридным квантованием смешанной точности, ориентированным на NVIDIA DGX Spark (GB10 Blackwell, sm_121). В этой модели используется гибридная стратегия квантования, оптимизированная для профиля пропускной способности DGX Spark (273 ГБ/с LPDDR5X, путь обслуживания управляемой памяти ~97 ГБ/с): Узким местом в декодировании MoE является экспертная проекция шлюза+вверх (~2/3 экспертных байтов). Стандартные кванты GGUF здесь используют IQ2XXS. NVFP4 считывает больше байтов (4,50 против 2,06 бит в секунду), но обеспечивает значительно лучшую точность при том же битовом бюджете, с пропускной способностью деквантования ~ 140 ГБ/с на GB10. На практике декодирование NVFP4 немного медленнее, чем IQ2XXS, из-за большего объема байтов, но выигрыш в точности оправдывает небольшие затраты на пропускную способность. Эксперты по снижению остаются Q2K (уже насыщают ~160 ГБ/с). Внимание и мнение экспертов остаются Q80 за качество. Контрольная точка источника HF хранит эксперты в MXFP4 (полубайты e2m1 + масштаб e8m0 на 32 блока). NVFP4 — это e2m1 + e4m3 на 16 + на эксперта по шкале fp322. Полубайты e2m1 идентичны** — преобразование представляет собой преобразование только масштаба. Никакого повторного квантования веса, никакой потери качества на этапе квантования. Веса NVFP4 побитно идентичны MXFP4…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: sleepyeldrazi
Теги: ds4, gguf, deepseek, deepseek-v4, deepseek-v4-flash, mixture-of-experts, reap, expert-pruning
Лайков: 5 | Загрузок: 2,219
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.