> [!TIP] > Поддержите эту работу: donate.sybilsolutions.ai > > Поверхность REAP: GLM | МиниМакс | Квен | Джемма | Бумага | Код | ПР17 | Коллекция Cerebras 𓌳 REAP𓌳 Эксперты: Почему сокращение преобладает при однократном сжатии MoE 📄 Бумага • 💻 Код • 📝 Блог GLM-4.7, сокращенный на 50% экспертами, оптимизирован для генерации кода, вызова функций и агентских рабочих процессов. Создано с использованием REAP (отсечение экспертной активации с учетом маршрутизатора) компанией Cerebras: — 358B → 179B: удалено 50% экспертов MoE (осталось 80/160) — Калибровка для кода и инструментов: сохраняет возможности кодирования и вызова функций — Одноразовое сжатие: точная настройка не требуется — Совместимость с встраиваемыми модулями: работает с vLLM, Transformers, SGLang — Prime Intellect — Спонсорство вычислений (кластер 8x H200) — Cerebras — Методология REAP Компания Cerebras использовала одни и те же 3 набора данных в своих экспериментах REAP GLM-4.6: — evol-codealpaca-v1 для генерации кода — xlam-function-calling-60k для вызова инструментов — SWE-smith-trajectories для агентских задач REAP вычисляет оценки значимости экспертов во время калибровки. Эти оценки не зависят от степени сжатия, что позволяет мгновенно сокращать любые коэффициенты: Если эта работа окажется полезной, поддержите Sybil Solutions здесь: https://donate.sybilsolutions.ai — Пожертвуйте:…
Модальности:
Генерация текста
Области применения:
Генерация кода Диалог / чат Вызов функций (Tool use)
Задача: Генерация текста
Автор: 0xSero
Теги: glm4_moe, glm, glm4, MOE, pruning, compression, reap, cerebras
Лайков: 19 | Загрузок: 286
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.