bg-digitalservices/Gemma-4-26B-A4B-it-NVFP4A16 - Каталог нейросетей
Генерация текста

bg-digitalservices/Gemma-4-26B-A4B-it-NVFP4A16

Добавлено:
bg-digitalservices/Gemma-4-26B-A4B-it-NVFP4A16

Первое квантование NVFP4 сообщества google/gemma-4-26B-A4B-it — вариант Gemma 4, созданный смешанными экспертами, с общим числом параметров 25,2 млрд и только 3,8 млрд активных на каждый токен. W4A16 — веса в FP4, активации в FP16 (квантование только по весу). — Сборка vLLM с преобразователями >= 5.4 (для поддержки архитектуры Gemma 4) — В DGX Spark / SM 12.1: spark-vllm-docker, построенный с флагом —tf5 — Включен gemma4patched.py` для загрузки ключа масштабирования NVFP4 MoE (см. патч vLLM). Это модель инструкций — используйте конечную точку завершения чата: протестировано на NVIDIA DGX Spark (128 ГБ единой памяти), GB10 Блэквелл, СМ 12.1). Модель загружается на 15,7 ГиБ — достаточно места для контекста 65 000+ с кэшем FP8 KV. Gemma 4 MoE хранит экспертные веса в виде объединенных трехмерных тензоров (nn.Parameter of shape [128, dim, dim]) вместо отдельных nn.Linear модулей. NVIDIA Model Optimizer (modelopt) квантует только nn.Linear — он молча пропускает экспертные 3D-параметры, которые составляют 91% модели. Мы написали плагин modelopt QuantGemma4TextExperts, который перед квантованием разделяет 3D-экспертные тензоры на 128 × 3 отдельных слоя nn.Linear. Это соответствует тому же шаблону, который modelopt использует для моделей Qwen3.5, Llama4 и DBRX MoE. После квантования…

Модальности:
Генерация текста

Области применения:
Диалог / чат Мультиязычность


Задача: Генерация текста
Автор: bg-digitalservices
Теги: gemma4, image-text-to-text, nvidia, nvfp4, modelopt, quantized, moe, dgx-spark
Лайков: 5  |  Загрузок: 914

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.