AEON-7/gemma-4-31B-it-speculator.eagle3-NVFP4 - Каталог нейросетей
Генерация текста

AEON-7/gemma-4-31B-it-speculator.eagle3-NVFP4

Добавлено:
AEON-7/gemma-4-31B-it-speculator.eagle3-NVFP4

Квантование NVFP4 RedHatAI/gemma-4-31B-it-speculator.eagle3 — официальный разработчик RedHat/Neural Magic EAGLE-3 для Gemma 4 31B (dense). Встроенная замена для чертежника BF16, в 3 раза меньше (4,5 ГБ → ~1,5 ГБ) и примерно в 1,5 раза быстрее на каждый шаг черновика на Blackwell с собственными тензорными ядрами FP4. Ориентирован на ту же модель верификатора, что и источник BF16. Верификатором может быть любой вариант Gemma 4 31B (плотный) — базовый, инструктирующий, NVFP4 или с тонкой настройкой (удаленный, настроенный на домен и т. д.). Разработчики EAGLE привязаны к архитектуре, а не к весу; Распределение выходных данных, очевидно, принадлежит проверяющему. Длина приема (относительно источника BF16 — опубликованные цифры RedHat): примерно 8–12% потерь приема по сравнению с BF16, что более чем компенсируется пошаговым ускорением на собственном оборудовании Blackwell FP4. Протестировано на NVIDIA DGX Spark (GB10, sm 12.1, 128 ГБ единой памяти) с использованием образа ghcr.io/aeon-7/vllm-spark-gemma4-nvfp4:latest (eugr nightly с ядрами FlashInfer CUTLASS + VLLMCUTLASS NVFP4, скомпилированными sm120). Однопоточные настенные часы: ускорение в 2,0–2,5 раза по сравнению с декодированием без спецификации при рабочих нагрузках чата. — model.safetensors — квантованные веса чертежника NVFP4 (~ 1,5 ГБ) — config.json — конфигурация спекулянта Eagle3 (содержит ссылку на верификатор) —…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: AEON-7
Теги: 31b, 4-bit, aarch64, aeon, aeon-7, arm64, blackwell, chunked-prefill
Лайков: 5  |  Загрузок: 475

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.