> [!TIP] > Поддержите эту работу → · X · GitHub · Документ REAP · Cerebras Квантование REAP NVFP4 zai-org/GLM-5.1, дальнейшее сокращение REAP из 256 → 160 маршрутизируемых экспертов на каждый уровень MoE. Настроен для работы в контексте с 200 000 токенов на рабочей станции Blackwell с памятью 4 × 96 ГБ. Однопользовательский, размер пакета 1, декодирование ток/с с различной длиной запросов на нашей эталонной установке (базовый путь с плотным MLA; значительно более быстрые числа с длинным контекстом см. в IndexCache ниже): Под живым смешанным трафиком (1495 образцов декодирования, базовая конфигурация): VRAM на каждый ранг при 202 752 ctx: вес 77,2 ГБ, пул KV 11,3 ГБ (270 тыс. токенов), графики CUDA 0,3 ГБ, ~5 ГБ бесплатно. — 4 × NVIDIA RTX PRO 6000 Blackwell Workstation Edition, 96 ГБ, вычислительная мощность 12,0 (sm120) — Драйвер NVIDIA 580.126.18, пользовательское пространство CUDA 12.9 — Ubuntu / Pop!OS 22.04, Python 3.12 Это цель настройки. Тот же рецепт работает на 4 × B200 (sm100), 8 × Hopper (sm90) с меньшим или более агрессивным квантованием и других конфигурациях Blackwell — см. матрицу совместимости оборудования внизу этой страницы. Конфигурация GLM-5.1 рекламирует GlmMoeDsaForCausalLM, который по умолчанию маршрутизирует через DeepSeek Sparse Attention. Каждый бэкэнд АНБ в сленге 0.5.10.post1 создан для…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: 0xSero
Теги: sglang, glm_moe_dsa, blackwell, glm, moe, nvfp4, reap, conversational
Лайков: 10 | Загрузок: 3,504
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.