Модуль awqmarlin в vllm не проверяет параметр elementstonotconvert при загрузке модулей AWQ-MoE, что приводит к сбою смешанного квантования MoE или сообщению об ошибках. См.: [[Проблема №21888]](https://github.com/vllm-project/vllm/pull/21888). Перед объединением PR временно замените awqmarlin.py в vllm/modelexecutor/layers/quantization/awqmarlin.py`. 👋 Присоединяйтесь к нашей группе WeChat. 📖 Прочтите технический блог GLM-4.5. 📍 Доступ к API GLM-4.5 через открытую платформу ZhipuAI. 👉 Попробуйте онлайн на GLM-4.5. Модельный ряд GLM-4.5 представляет собой базовую модель, предназначенную для агентов. GLM-4.5 имеет 355 миллиардов параметров, из которых 32 миллиарда являются активными. GLM-4.5-Air имеет более компактную конструкцию с 106 миллиардами общих параметров и 12 миллиардами активных параметров. Модели GLM-4.5 объединяют рассуждения, кодирование и возможности агентов для удовлетворения сложных требований агентных приложений. И GLM-4.5, и GLM-4.5-Air представляют собой гибридные модели рассуждения, которые предлагают два режима: режим мышления для сложных рассуждений и использования инструментов и режим без мышления для мгновенных ответов. Мы открыли исходный код базовых моделей, гибридных моделей рассуждений и версий FP8 GLM-4.5 и GLM-4.5-Air. Они выпущены под…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: QuantTrio
Теги: glm4_moe, AWQ, FP16Mix, quantization fix, vLLM, conversational, endpoints_compatible, 4-bit
Лайков: 14 | Загрузок: 2,097
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.