olka-fi/Hy3-MXFP4 - Каталог нейросетей
Генерация текста

olka-fi/Hy3-MXFP4

Добавлено:
olka-fi/Hy3-MXFP4

> 4-битное квантование MXFP4 tencent/Hy3. > Оригинальная карта модели полностью сохранена ниже. Квант MXFP4 только по весу, создаваемый с помощью qstream: маршрутизируемые эксперты MoE (≈95% весов) квантуются до 4-бит; все, что важно для качества, остается BF16. > Обратите внимание на количество параметров HF. HF сообщает меньше «параметров», чем базовый 295B, поскольку он считает упакованные 4-битные элементы хранения (каждый байт U8 содержит два веса FP4) плюс шкалы FP8, а не логические параметры. Логическая модель не изменилась: всего 295B, 21B активно. Функциональные оценки выполняются сквозным образом на одном NVIDIA B300 (275 ГБ) — контрольная точка обслуживает и генерирует согласованно, поэтому это проверенное поведение, а не просто числовая близость. Пропускная способность с включенным MTP: ±850 ток/с Изменились только веса маршрутизируемого эксперта FFN — ~95% весов повторно квантуются в MXFP4; все остальное (внимание, общий эксперт, роутер, норм, встраивания) побитно идентично BF16 исходнику. — MTP сохранен: черновой уровень прогнозирования нескольких токенов (уровень 80) обслуживается с помощью —speculative-config ‘{«method»:»mtp»,»numspeculativetokens»:1}’ и достигает 82,8% принятия черновых токенов. Он без потерь — GSM8K при нем не меняется (как и должно быть при спекулятивном декодировании). -…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: olka-fi
Теги: hy_v3, hunyuan, hy3, moe, mxfp4, compressed-tensors, quantized, vllm
Лайков: 5  |  Загрузок: 1,931

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.