0xSero/GLM-4.7-REAP-40-W4A16 - Каталог нейросетей
Генерация текста

0xSero/GLM-4.7-REAP-40-W4A16

Добавлено:
0xSero/GLM-4.7-REAP-40-W4A16

> [!TIP] > Поддержите эту работу → · X · GitHub · REAP paper · Cerebras REAP 𓌳 REAP𓌳 Эксперты: Почему сокращение преобладает при однократном сжатии MoE 📄 Бумага • 💻 Код • 📝 Блог 40% Expert-Pruned + INT4 Quantized — Двойное сжатие для эффективного развертывания. — Общее сжатие ~6,5x: 700 ГБ → ~108 ГБ — REAP + AutoRound: экспертное сокращение + весовое квантование — Оптимизировано для кода и инструментов: калибровано при генерации кода и вызове функций — Меньше видеопамяти: подходит для в 2–4 раза меньше графических процессоров, чем BF16 Компания Cerebras использовала те же 3 набора данных в своих экспериментах GLM-4.6 REAP: — evol-codealpaca-v1 для генерации кода — xlam-function-calling-60k для вызова инструментов — SWE-smith-trajectories для агентских задач. Стало возможным благодаря NVIDIA · Технология TNG · Lambda · Prime Intellect · Hot Aisle.

Модальности:
Генерация текста

Области применения:
Генерация кода Диалог / чат Вызов функций (Tool use)


Задача: Генерация текста
Автор: 0xSero
Теги: glm4_moe, 4bit, MOE, autoround, cerebras, code, compression, function-calling
Лайков: 7  |  Загрузок: 69

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.