CosmicRaisins/GLM-5.2-MTP-INT4-15pct - Каталог нейросетей
Генерация текста

CosmicRaisins/GLM-5.2-MTP-INT4-15pct

Добавлено:
CosmicRaisins/GLM-5.2-MTP-INT4-15pct

Отдельный проект MTP (многотокеновое предсказание) предназначен для спекулятивного декодирования с помощью CosmicRaisins/GLM-5.2-AWQ-INT4-15pct. cyankiwi/GLM-5.2-AWQ-INT4 удаляет собственный уровень MTP GLM-5.2, поэтому он реконструируется как отдельный черновик INT4, который vLLM загружает через —speculative-config (который также обходит vLLM # 35041 / # 38494). Сжатые тензоры INT4, один слой MTP, 218 экспертов для соответствия сокращенной цели. ~4,8 ГБ. k=3 для меня лучше всего подходит для синтетического корпуса; Z.ai рекомендует k=5, и я еще не сравнивал их в реальных условиях. Стек обслуживания: github.com/CosmicRaisins/glm-5.2-gb10. Веса MTP соответствуют исходному заголовку MTP GLM-5.2 (Z.ai, MIT), полученному через уровень NVFP4-78 0xSero (0xSero/GLM-5.2-NVFP4-REAP-469B), затем деквантованному, повторно квантованному до INT4, экспертному сокращению до 218 и согласованному с макетом загрузчика DeepSeekMTP. Реконструкция и выравнивание мои. Лицензия MIT, унаследованная от базы GLM-5.2: веса MTP переносят грант MIT GLM-5.2 через квантование 0xSero (репозиторий 0xSero декларирует отсутствие явной лицензии). Приписывается Z.ai и 0xSero; не связан ни с тем, ни с другим.

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: CosmicRaisins
Теги: glm_moe_dsa, glm, glm-5.2, mtp, speculative-decoding, draft-model, int4, gb10
Лайков: 5  |  Загрузок: 195

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.