В этом репозитории представлены квантованные сборки zai-org/GLM-4.7 (модель Mixture-of-Experts), переупакованные для vLLM с использованием формата сжатых тензоров. > Почему этот количественный показатель отличается (калибровка с учетом MoE) > — Во время калибровки мы активируем всех экспертов (а не только тех немногих, которые выбираются маршрутизатором для каждого токена). > — Это фиксирует наихудшие активации между экспертами, обеспечивая более надежные шкалы и меньший дрейф количественных ошибок при выводе, особенно при подсказках, которые запускают нетипичных экспертов. > — Прилагаемый PR к llm-compressor добавляет средства моделирования семейства GLM для поддержки этого потока с учетом MoE (маршрутизатор/экспертная обработка, согласованная с архитектурой GLM). > — Конечный эффект: более чистая запутанность и стабильность, меньше артефактов в крайних случаях и лучшая передача домена при увольнении новых экспертов. > TL;DR > — Квантование с помощью W4A16 (веса INT4/активации A16) для vLLM через —quantization compressed-tensors. > — Три ветки по размеру группы: W4A16GS32, W4A16GS64, W4A16GS128. > — Калибровка: 512 образцов чата, максимальная длина последовательности 2048, калибровка набора данных Neuralmagic/LLMcompression (сообщения визуализируются с помощью шаблона чата модели). > — AWQ только по весу; lmhead сохранил высокую точность; экспортировано с…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: TheHouseOfTheDude
Теги: vllm, conversational, compressed-tensors, awq, w4a16, quantized, moe, en
Лайков: 5 | Загрузок: 6
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.