GLM-5.2-NVFP4-AQLM-hybrid
Параметр GLM-5.2 с 744 байтами, квантованный с помощью двухуровневой схемы NVFP4+AQLM для каждого эксперта, обслуживает полный кэш KV...
Параметр GLM-5.2 с 744 байтами, квантованный с помощью двухуровневой схемы NVFP4+AQLM для каждого эксперта, обслуживает полный кэш KV...
Составитель спекулятивного декодирования блока-диффузии DFlash для GLM-5.2-FP8 (743B MoE, 39B активен). Стандартный метод DFlash (без расширений), обучение с...
Восстановленный из отзыва повторный REAP GLM-5.2-NVFP4 — 172 эксперта на уровень (из 256), самосогласованный, веса BF16 сохранены, эксперты...
Квантование zai-org/GLM-5.2 смешанной точности Apple Silicon (MLX) — модель смеси экспертов с параметрами 744B (~40B активная) с MLA...
Квантование NVFP4 (4-битное) zai-org/GLM-5.2, созданное с помощью NVIDIA TensorRT Model Optimizer 0.44.0. Экспертные FFN MoE (маршрутизируемые + общие)...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем GLM-4.7-REAP-268B-A32B, сжатый вариант GLM-4.7 с эффективным использованием...
Исходная модель: https://huggingface.co/cerebras/MiniMax-M2-REAP-162B-A10B Все кванты созданы с использованием опции imatrix с набором данных отсюда в сочетании с подмножеством...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем GLM-4.6-REAP-252B-A32B-FP8, сжатый вариант GLM-4.6-FP8 с эффективным использованием...
Предупреждение: в llama.cpp b6607 и более поздних версиях изменение внутреннего кода cuda приведет к другим результатам генерации, даже...
> [!TIP] > Поддержите эту работу → · X · GitHub · Документ REAP · Cerebras REAP Это...