GLM-4.6-NVFP4
Квантованная версия GLM-4.6 с использованием LLM Compressor и формата NVFP4 (E2M1 + E4M3). Это должно стать началом новой...
Квантованная версия GLM-4.6 с использованием LLM Compressor и формата NVFP4 (E2M1 + E4M3). Это должно стать началом новой...
Это всего лишь быстрое сочетание кванта 2,25 бита в неделю с вниманием, плотными слоями и общими экспертами в...
Высокопроизводительное AWQ-квантование ZHIPU AI GLM-4.6 (357B MoE), оптимизированное для вывода vLLM. Это профессионально квантованная 4-битная AWQ-версия Z.ai GLM-4.6,...
По состоянию на 1 октября 2025 г. создайте новую среду Python и запустите: 👋 Присоединяйтесь к нашему сообществу...
👋 Присоединяйтесь к нашему сообществу Discord. 📖 Ознакомьтесь с техническим блогом GLM-4.5, техническим отчетом и технической документацией Zhipu...
Это версия Huihui-GLM-4.5-Air-abliterated-GGUF с потерями защитных тензоров, которую можно запускать с преобразователями Huggingface, поскольку исходная версия не включала...
👋 Присоединяйтесь к нашему сообществу Discord. 📖 Посетите технический блог GLM-4.5. 📍 Используйте сервисы API GLM-4.5 на платформе...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем GLM-4.7-REAP-268B-A32B, сжатый вариант GLM-4.7 с эффективным использованием...
我们在做什么: — 推理加速:实现了 Eagle3 для обучения на Qwen3-8B (более 20 000 загрузок),显著提升LLM推理速度 — Производительность графического процессора: AIGC, поддержка...
Мы разработали метод квантования только по весу, специально предназначенный для архитектуры Mixture-of-Experts (MoE), и выпустили GLM-4.5-Air, квантованный с...