melcheikh/gemma-4-31B-it-qat-assistant-NVFP4-Blackwell - Каталог нейросетей
Генерация текста

melcheikh/gemma-4-31B-it-qat-assistant-NVFP4-Blackwell

Добавлено:
melcheikh/gemma-4-31B-it-qat-assistant-NVFP4-Blackwell

Этот репозиторий содержит черновик модели Gemma 4 31B Instruction-Tuned Assistant, квантованный до собственной точности FP4 (NVFP4) для высокоэффективного вывода на архитектурах графических процессоров NVIDIA Blackwell (например, B200, B100). Этот помощник предназначен для использования в качестве черновой модели для спекулятивного декодирования наряду с основной моделью gemma-4-31B-it-qat-NVFP4-Blackwell. — Базовая модель: google/gemma-4-31B-it-qat-q40-unquantized-assistant — Формат квантования: NVFP4 (родной FP4 на Blackwell) — Размер группы: 16 (масштабирование по группам) — Исключенные модули: lmhead — Продюсер: Оптимизатор моделей NVIDIA (modelopt) Если вы попытаетесь запустить спекулятивное декодирование с использованием этой квантованной модели помощника NVFP4 в vLLM, вы можете столкнуться со следующей ошибкой инициализации: по умолчанию загрузчик MTP (Multi-Token Prediction) vLLM (gemma4mtp.py) предполагает, что модель помощника не квантована. Из-за этого он инициализирует слои MLP (Gemma4MLP) и проекции внимания (Gemma4MTPAttention) с quantconfig =None, ожидая полноразмерные веса (например, shape [1024, 8192]) вместо квантованных/упакованных весов ModelOpt (shape [1024, 4096]). Чтобы исправить это, отредактируйте файл пакета vllm vllm/modelexecutor/models/gemma4mtp.py в своем…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: melcheikh
Теги: gemma4_assistant, tensorizer, modelopt, nvidia, fp4, nvfp4, blackwell, vllm
Лайков: 4  |  Загрузок: 55

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.