canada-quant/DeepSeek-V4-Flash-W4A16-FP8-MTP - Каталог нейросетей
Генерация текста

canada-quant/DeepSeek-V4-Flash-W4A16-FP8-MTP

Добавлено:
canada-quant/DeepSeek-V4-Flash-W4A16-FP8-MTP

W4A16 INT4 маршрутизирует экспертов + блок FP8 128×128 внимания + черновой заголовок BF16 Multi-Token Prediction (MTP) сохранен — первое квантование DeepSeek-V4-Flash, которое поставляет рабочий блок MTP, что дает ~1,5-кратное ускорение спекулятивного декодирования (spec-decode) при bs=1 без потери качества. Расширение предшественника W4A16-FP8 путем исправления пути калибровки трансформаторов, чтобы блок MTP выдерживал нагрузку. Предшественник W4A16-FP8 и RedHatAI/DeepSeek-V4-Flash-NVFP4-FP8 отбрасывают блок MTP, поскольку DeepseekV4PreTrainedModel преобразователя 5.8.1 заявляет: который молча фильтрует каждый mtp. тензор в момент предварительной подготовки — без предупреждения, без ошибок. Конвейеры калибровки, которые проходят frompretrained, производят квантованные основные веса в паре с отсутствующим блоком MTP; при обслуживании возвращается к простому декодированию, теряя ускорение декодирования по спецификации примерно в 1,5–2 раза, которое обеспечивает архитектура V4-Flash. Этот артефакт обходит молчаливое падение, выполняет полную 8-ранговую калибровку GPTQ на корпусе из 768 выборок против основных маршрутизируемых экспертов, сохраняет блок MTP неквантованным в BF16 и создает обслуживающий артефакт, в котором фактически срабатывает спекулятивное декодирование. Тот же артефакт, вес между SKU не меняется. Оба проверены cuda…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: canada-quant
Теги: vllm, deepseek_v4, deepseek, compressed-tensors, w4a16, gptq, fp8, mtp
Лайков: 8  |  Загрузок: 13,942

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.