cerebras/Kimi-Linear-REAP-35B-A3B-Instruct - Каталог нейросетей
Генерация текста

cerebras/Kimi-Linear-REAP-35B-A3B-Instruct

Добавлено:
cerebras/Kimi-Linear-REAP-35B-A3B-Instruct

𓌳 REAP𓌳 Эксперты: почему обрезка преобладает при однократном сжатии MoE Представляем Kimi-Linear-REAP-35B-A3B-Instruct, сжатый вариант Kimi-Linear-48B-A3B-Instruct с эффективным использованием памяти, который сохраняет почти идентичную производительность, будучи на 30 % легче. Эта модель была создана с использованием REAP (router-weighted Expert Activation Pruning), нового метода сокращения экспертов, который выборочно удаляет лишних экспертов, сохраняя при этом независимый контроль маршрутизатора над оставшимися экспертами. Ключевые особенности включают в себя: — Производительность почти без потерь: обеспечивает почти такую ​​же точность при генерации кода, агентном кодировании и вызове функций по сравнению с полной моделью 48B. — Сокращение памяти на 30 %: параметры сжаты с 48B до 35B, что значительно снижает затраты на развертывание и требования к памяти. — Сохраненные возможности: сохраняются все основные функции, включая генерацию кода, математические расчеты и рассуждения, а также возможности ответа на вопросы в длинном контексте. — Совместимость с прямым подключением: работает с ванильным vLLM — не требуется никаких модификаций исходного кода или пользовательских исправлений. — Оптимизирован для реального использования: особенно эффективен для сред с ограниченными ресурсами, локального развертывания и академических исследований. Эталонный тест…

Модальности:
Генерация текста

Области применения:
Диалог / чат Следование инструкциям


Задача: Генерация текста
Автор: cerebras
Теги: kimi_linear, kimi, MOE, pruning, compression, conversational, custom_code, en
Лайков: 68  |  Загрузок: 23

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.