Параметр GLM-5.2 с 744 байтами, квантованный с помощью двухуровневой схемы NVFP4+AQLM для каждого эксперта, обслуживает полный кэш KV размером ~1 млн токенов на 4 графических процессорах SM120 по 96 ГБ (вес 292 ГБ). Не стандартный vLLM — здесь используется предварительно исправленная вилка, указанная выше (DCP + собственные исправления MTP + SM120 разреженного MLA) и исправленная вилка LMCache (jarrelscy/LMCache@glm52-dcp-dsa); стандартный vLLM/LMCache не может обслуживать этот профиль. tp4-1m-mtp — это спекулятивное декодирование MTP без потерь TP4 + DCP4 +, согласованное с ~1 млн токенов, с сохранением KV на диске (LMCache) по умолчанию — восстановление с диска вместо повторных вычислений по повторяющемуся/перекрывающемуся запросу (~78 раз быстрее при попадании ~920 тыс. токенов при тестировании). Все 6 шлюзов проверки LMCache прошли на этом оборудовании; подробности обслуживания см. ниже и на сайте BENCHMARKING.md. Установите -e ENABLELMCACHE=0 для отключения или -e PARALLEL=` для другой конфигурации (см. Альтернативы). В этой сборке по сравнению с первой версией добавлены: экспертный повторный уровень измеренных ошибок (нейтральная по байтам горячая/холодная замена, перемещающая бюджет NVFP4 из ранних слоев, где 2-битная реконструкция почти бесплатна, в глубокие уровни, где он был нехваткой) и PV-настройка всех холодных кодовых книг/шкал по отношению к учителю BF16 в соответствии с новым заданием (отложенная ранняя остановка). — Горячие эксперты — NVFP4 @ 4,5 бита в секунду:…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: jarrelscy
Теги: glm_moe_dsa, glm, moe, nvfp4, aqlm, quantized, 1m-context, conversational
Лайков: 6 | Загрузок: 2,438
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.