UCloud-org/GLM-5.2-FP8-DFlash - Каталог нейросетей
Генерация текста

UCloud-org/GLM-5.2-FP8-DFlash

Добавлено:
UCloud-org/GLM-5.2-FP8-DFlash

Составитель спекулятивного декодирования блока-диффузии DFlash для GLM-5.2-FP8 (743B MoE, 39B активен). Стандартный метод DFlash (без расширений), обучение с помощью SpecForge по рецепту данных, указанному в документе: ~800 тыс. образцов Nemotron-Post-Training-v2 + CodeAlpaca (код/математика/чат), все ответы регенерируются с помощью GLM-5.2-FP8, 6 эпох — напрямую сопоставимы с документом DFlash и серией составителей z-lab. vLLM v0.20.1+ имеет встроенную поддержку DFlash и считывает эту контрольную точку напрямую, без необходимости преобразования. Еще не проверено во время выполнения в нашей инфраструктуре; результаты ниже были получены с помощью SGLang. Измерено при реальном обслуживании SGLang (параллелизм 1, жадное декодирование, если не указано иное). Встроенная базовая версия MTP использует официальный рецепт GLM-5.2 (EAGLE, шаги 5 / топк 1 / черновые токены 6). Этот редактор оптимизирован с точки зрения кода и математики: он обеспечивает производительность в 1,4–1,5 раза выше (и без того мощного) встроенного MTP при работе с кодом и математическими нагрузками, в то время как рабочие нагрузки чата и китайского языка немного отдают предпочтение встроенному MTP (см. Ограничения). ceval (китайский) — самый слабый домен — в обучающем корпусе доминирует английский (см. Ограничения). Также отражено в ModelScope: UCloud-AILab/GLM-5.2-FP8-DFlash. — Целевая модель: GLM-5.2-FP8 (скрыто 6144, 78 слоев; чертежник…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: UCloud-org
Теги: qwen3, feature-extraction, dflash, speculative-decoding, draft-model, block-diffusion, glm, custom_code
Лайков: 6  |  Загрузок: 1,193

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.