> [!TIP] > Поддержите эту работу → · X · GitHub · Документ REAP · Cerebras REAP W4A16, квантованная версия официального GLM-4.6-REAP-218B-A32B Cerebras. — Уменьшение размера примерно в 4 раза: ~436 ГБ → ~116 ГБ — Работает на потребительском оборудовании: 8x RTX 3090 или 4x RTX 4090 — Совместимость с vLLM/SGLang: прямое развертывание Компания Cerebras использовала те же 3 набора данных в своих экспериментах с REAP GLM-4.6: — evol-codealpaca-v1 для генерации кода — xlam-function-calling-60k для вызова инструментов — SWE-кузнец-траектории для агентских задач. Стало возможным благодаря NVIDIA · TNG Technology · Lambda · Prime Intellect · Hot Aisle.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: 0xSero
Теги: glm4_moe, 4bit, MOE, autoround, cerebras, glm, glm4, pruning
Лайков: 8 | Загрузок: 31
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.