Восстановленный из отзыва повторный REAP GLM-5.2-NVFP4 — 172 эксперта на уровень (из 256), самосогласованный, веса BF16 сохранены, эксперты NVFP4 нарезают побайтно. — Рецепт + стек подачи: github.com/brandonmmusic-max/GLM-5.2-Reap — Образ Docker: verdictai/glm52-nvfp4-dcpmtp:v3.3 — Методология значимости + реестр корпуса: REAPRECALLVERDICT.md — Проверенный сценарий запуска: serveglm52reaprecall.sh` > Атрибуция: GLM-5.2 от z.ai · Квантование NVFP4 Люка Алонсо · REAP от Cerebras Research (arXiv:2510.13999, ICLR 2026). Все аргументированные подсказки по-прежнему проходят (8/8 ловушек; трубы/силлогизм/скидка/упреждающее отречение – все финиш=стоп). > Необязательно — thinktokenbudget (жесткое ограничение цикла рассуждений): смонтируйте четыре файла исправлений V2 из репозитория в контейнер и добавьте —reasoning-config ‘{«reasoningstartstr»:»»,»reasoningendstr»:»»}’, затем передайте «thinkingtokenbudget»: N в теле запроса. Без этих патчей оставьте параметр —reasoning-config выключенным — на простом изображении он блокирует `priming glm45, и путь чата перестает думать. Для генерации без мышления установите Enablethinking: false. Для эссе в стиле Марбери рекомендуется максимальное количество токенов >= 1500 (для размышлений требуется место). — z.ai (база GLM-5.2) — Люк Алонсо (NVFP4…
Модальности:
Генерация текста
Области применения:
Диалог / чат Юриспруденция
Задача: Генерация текста
Автор: brandonmusic
Теги: glm_moe_dsa, reap, mixture-of-experts, moe-pruning, nvfp4, glm, legal, vllm
Лайков: 6 | Загрузок: 2,869
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.