GLM-4.5-Air-GPTQ-Int4-Int8Mix
👋 Присоединяйтесь к нашей группе WeChat. 📖 Прочтите технический блог GLM-4.5. 📍 Используйте сервис API GLM-4.5 на открытой...
👋 Присоединяйтесь к нашей группе WeChat. 📖 Прочтите технический блог GLM-4.5. 📍 Используйте сервис API GLM-4.5 на открытой...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем GLM-4.6-REAP-268B-A32B, сжатый вариант GLM-4.6 с эффективным использованием...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем GLM-4.6-REAP-268B-A32B-FP8, сжатый вариант GLM-4.6-FP8 с эффективным использованием...
Модуль awqmarlin в vllm не проверяет параметр elementstonotconvert при загрузке модулей AWQ-MoE, что приводит к сбою смешанного квантования...
Модель NVIDIA GLM-4.7 NVFP4 — это квантованная версия модели ZAI GLM-4.7, которая представляет собой авторегрессионную языковую модель, использующую...
Эта модель mlx-community/GLM-4.6-4bit была конвертирована в формат MLX из zai-org/GLM-4.6 с использованием mlx-lm версии 0.28.1. Модальности:Генерация текста Области...
Формат: NVFP4 — оптимальное частичное квантование весов и активаций в NVFP4. Базовая модель: zai-org/GLM-4.7. Как это было сделано:...
Эта модель mlx-community/GLM-4.5-4bit была конвертирована в формат MLX из zai-org/GLM-4.5 с использованием mlx-lm версии 0.26.0. Модальности:Генерация текста Области...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем GLM-4.7-REAP-218B-A32B-FP8, сжатый вариант GLM-4.7-FP8 с эффективным использованием...
𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем GLM-4.6-REAP-218B-A32B-FP8, сжатый вариант GLM-4.6-FP8 с эффективным использованием...