GLM-5.2-NVFP4-AQLM-hybrid
Параметр GLM-5.2 с 744 байтами, квантованный с помощью двухуровневой схемы NVFP4+AQLM для каждого эксперта, обслуживает полный кэш KV...
Параметр GLM-5.2 с 744 байтами, квантованный с помощью двухуровневой схемы NVFP4+AQLM для каждого эксперта, обслуживает полный кэш KV...
Восстановленный из отзыва повторный REAP GLM-5.2-NVFP4 — 172 эксперта на уровень (из 256), самосогласованный, веса BF16 сохранены, эксперты...
Квантование zai-org/GLM-5.2 смешанной точности Apple Silicon (MLX) — модель смеси экспертов с параметрами 744B (~40B активная) с MLA...
Квантование NVFP4 (4-битное) zai-org/GLM-5.2, созданное с помощью NVIDIA TensorRT Model Optimizer 0.44.0. Экспертные FFN MoE (маршрутизируемые + общие)...
Эта модель mlx-community/GLM-5.1-DQ4plus-q8 была преобразована в формат MLX из zai-org/GLM-5.1 с использованием mlx-lm версии 0.31.2. Это создано для...
Этот репозиторий квантует модель с использованием квантования без данных (набор калибровочных данных не требуется). По состоянию на 26...
Эта модель mlx-community/GLM-5-4bit была преобразована в формат MLX из zai-org/GLM-5 с использованием mlx-lm версии 0.30.7. Модальности:Генерация текста Области...
> [!TIP] > Поддержите эту работу → · X · GitHub · Документ REAP · Cerebras REAP Это...
— Одиночный вывод ~14,1 токена/с при 1000 токенов (отладочная сборка) — Пакетный вывод ~20,4 общего токена/с для двух...
> [!TIP] > Поддержите эту работу → · X · GitHub · Документ REAP · Cerebras Квантование REAP...