bullpoint/GLM-4.6-AWQ - Каталог нейросетей
Генерация текста

bullpoint/GLM-4.6-AWQ

Добавлено:
bullpoint/GLM-4.6-AWQ

Высокопроизводительное AWQ-квантование ZHIPU AI GLM-4.6 (357B MoE), оптимизированное для вывода vLLM. Это профессионально квантованная 4-битная AWQ-версия Z.ai GLM-4.6, оптимизированная для высокопроизводительного производственного развертывания с vLLM. — Базовая модель: GLM-4.6 (357B параметров, 160 экспертов MoE) — Размер модели: 176 ГБ (39 файлов Safetensors) — Лицензия: MIT (наследована от базовой модели) — Квантование: 4-битное AWQ с размером группы 128 — Активные параметры: 28,72B на токен (8 из 160 экспертов) — Структура квантования: llmcompressor 0.8.1.dev0 — Оптимизация: ядра Marlin для графических процессоров NVIDIA — Длина контекста: до 200 тысяч токенов (рекомендуется 131 тысяч для оптимальной производительности) — Языки: английский, китайский Протестировано на 4 видеокартах NVIDIA RTX PRO 6000 Blackwell Max-Q (по 96 ГБ каждый, общий объем видеопамяти 384 ГБ): — Эффективность полосы пропускания памяти: 50,3% (отлично для моделей MoE) — Теоретическая Максимум: 130 ток/с (ограничение пропускной способности памяти) – Совокупная пропускная способность: эффективная 1,7 ТБ/с (4× RTX PRO 6000 Blackwell Max-Q) – Фактическое и теоретическое: типично для разреженной архитектуры MoE Исследования показывают: AWQ имеет падение MMLU на ~1 балл, а GPTQ – на ~2 балла. Производительность AWQ неотличима от полноценного BF16 в реальных тестах. — Размер загрузки модели: 176 ГБ…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: bullpoint
Теги: glm4_moe, conversational, awq, quantized, 4-bit, vllm, moe, mixture-of-experts
Лайков: 5  |  Загрузок: 424

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.