GadflyII/GLM-4.7-Flash-MTP-NVFP4 - Каталог нейросетей
Генерация текста

GadflyII/GLM-4.7-Flash-MTP-NVFP4

Добавлено:
GadflyII/GLM-4.7-Flash-MTP-NVFP4

Это квантование NVFP4 смешанной точности zai-org/GLM-4.7-Flash, модель Mixture-of-Experts 30B-A3B (30B всего, 3B активно). Эта версия сохраняет уровни MTP (многотокенное предсказание) в BF16 для совместимости с спекулятивным декодированием. Эта модель использует смешанную точность для сохранения точности и функциональности MTP: качество MTP сохраняется (фактически немного улучшается) после квантования. Спекулятивное декодирование MTP в настоящее время демонстрирует накладные расходы, а не ускорение из-за отсутствия поддержки torch.compile для модели составления MTP в vLLM. Для достижения наилучшей пропускной способности запускайте без включения MTP, пока проблема не будет решена в восходящем направлении. — vLLM: 0.8.0+ (для поддержки NVFP4 со сжатыми тензорами) — Трансформаторы: 5.0.0+ (для архитектуры glm4moelite) — Графический процессор: NVIDIA GPU с поддержкой тензорных ядер FP4 (Blackwell, Hopper, Ada Lovelace) — Базовая модель: zai-org/GLM-4.7-Flash — Архитектура: Glm4MoeLiteForCausalLM — Параметры: всего 30B, 3B активных на токен (30B-A3B) — Конфигурация MoE: 64 перенаправленных эксперта, 4 активных, 1 общий эксперт — Слои: 47 (с 1 слоем MTP) — Длина контекста: 202 752 токена (макс.) — Языки: английский, китайский — Формат: сжатые тензоры (NVFP4) — Размер блока: 16 — Формат шкалы: FP8 (E4M3) — Калибровка: 512…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: GadflyII
Теги: glm4_moe_lite, moe, nvfp4, quantized, vllm, glm, 30b, mtp
Лайков: 5  |  Загрузок: 671

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.