canada-quant/hy3-w4a16-mtp - Каталог нейросетей
Генерация текста

canada-quant/hy3-w4a16-mtp

Добавлено:
canada-quant/hy3-w4a16-mtp

> Выпущено 16 июля 2026 г. Все этапы пройдены: проверка артефакта (—check-mtp), > качество по сравнению с FP8 (стандартный + режим рассуждения), приемка MTP, обслуживание дымовых тестов и > полная матрица тестов против базового уровня FP8 и ведущих 4-битных квантов сообщества > (полная методология + контрольный журнал в сопутствующем репозитории docs/RUNLOG.md). Tencent Hy3 квантуется в W4A16 с помощью GPTQ — маршрутизируемые эксперты MoE в INT4, все остальные веса (внимание, плотный слой 0, общий эксперт, голова NextN/MTP) сохраняются в BF16. Готов к vLLM (выбирает ядро ​​INT4×FP16 Marlin/Machete при загрузке). Один и тот же блок, одинаковая комплектация, одинаковые настройки для каждого столбца (8 × H100-SXM, vLLM 0.25.1 — методология ниже): Качество — это статистическое равенство с базовым уровнем FP8 при 57 % занимаемой площади — и среди 4-битных квантов это артефакт, который сочетает в себе сохраненный MTP (+40 % однопоточного по сравнению с той же схемой, без MTP AngelSlim), корону пропускной способности с высоким параллелизмом. (+21% по сравнению с FP8 при концентрации 32), внимание BF16 (наименьшее количество непроверенных поверхностей в длительном контексте) и полностью воспроизводимый, проверенный конвейер. Стандартный vLLM ≥ 0,25 — никаких пользовательских патчей и вилок. Одноразовый скрипт и образ Docker в сопутствующем репозитории (scripts/quickstarthopper.sh,…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: canada-quant
Теги: vllm, hy_v3, hy3, hunyuan, w4a16, gptq, int4, compressed-tensors
Лайков: 5  |  Загрузок: 1,895

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.