cerebras/DeepSeek-V3.2-REAP-345B-A37B - Каталог нейросетей
Генерация текста

cerebras/DeepSeek-V3.2-REAP-345B-A37B

Добавлено:
cerebras/DeepSeek-V3.2-REAP-345B-A37B

𓌳 REAP𓌳 Эксперты: почему для однократного сжатия MoE преобладает обрезка Представляем DeepSeek-V3.2-REAP-345B-A37B, сжатый вариант DeepSeek-V3.2 с эффективным использованием памяти, который поддерживает почти идентичную производительность, но при этом на 50% легче. Эта модель была создана с использованием REAP (router-weighted Expert Activation Pruning), нового метода сокращения экспертов, который выборочно удаляет лишних экспертов, сохраняя при этом независимый контроль маршрутизатора над оставшимися экспертами. Ключевые особенности включают в себя: — Производительность почти без потерь: обеспечивает почти такую ​​же точность генерации кода, агентного кодирования и задач вызова функций по сравнению с полной моделью 671B. — Сокращение памяти на 50 %: сжатие параметров 671B до 345B, что значительно снижает затраты на развертывание и требования к памяти. — Сохраненные возможности: сохраняются все основные функции, включая генерацию кода, математические вычисления и вызов инструментов. — Совместимость с прямым подключением: работает с ванильным vLLM — не требуется никаких модификаций исходного кода или пользовательских патчей. — Оптимизирован для реального использования: особенно эффективен для сред с ограниченными ресурсами, локального развертывания и научных исследований. Приведенные выше оценки были выполнены с температурой = 0,0; maxtokens=60000 для…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: cerebras
Теги: deepseek_v3, deepseek, MOE, pruning, compression, en, text-generation-inference, endpoints_compatible
Лайков: 34  |  Загрузок: 524

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.