cerebras/GLM-4.5-Air-REAP-82B-A12B - Каталог нейросетей
Генерация текста

cerebras/GLM-4.5-Air-REAP-82B-A12B

Добавлено:
cerebras/GLM-4.5-Air-REAP-82B-A12B

𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем GLM-4.5-Air-REAP-82B-A12B, сжатый вариант GLM-4.5-Air с эффективным использованием памяти, который сохраняет почти идентичную производительность, будучи на 25 % легче. Эта модель была создана с использованием REAP (router-weighted Expert Activation Pruning), нового метода сокращения экспертов, который выборочно удаляет лишних экспертов, сохраняя при этом независимый контроль маршрутизатора над оставшимися экспертами. Ключевые особенности включают в себя: — Производительность почти без потерь: обеспечивает почти такую же точность при генерации кода, агентном кодировании и вызове функций по сравнению с полной моделью 106B. — Сокращение памяти на 25 %: сжатие параметров со 106B до 82B, что значительно снижает затраты на развертывание и требования к памяти. — Сохраненные возможности: сохраняются все основные функции, включая генерацию кода, агентские рабочие процессы, понимание масштаба репозитория и вызов функций. — Совместимость с встраиваемыми модулями: работает. с ванильным vLLM — не требуется никаких модификаций исходного кода или пользовательских исправлений — Оптимизирован для реального использования: особенно эффективен для сред с ограниченными ресурсами, локального развертывания и академических исследований. Тест GLM-4.5-Air…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: cerebras
Теги: glm4_moe, glm, MOE, pruning, compression, conversational, en, endpoints_compatible
Лайков: 109  |  Загрузок: 712

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.