Kimi Linear: выразительная и эффективная архитектура внимания (a) На MMLU-Pro (длина контекста 4 КБ) Kimi Linear достигает производительности 51,0 со скоростью, аналогичной скорости полного внимания. На RULER (длина контекста 128 тыс.) он показывает оптимальную по Парето производительность (84,3) и ускорение в 3,98 раза. (б) Kimi Linear обеспечивает TPOT в 6,3 раза быстрее по сравнению с MLA, обеспечивая значительное ускорение при больших длинах последовательностей (1 млн токенов). Kimi Linear — это гибридная архитектура линейного внимания, которая превосходит традиционные методы полного внимания в различных контекстах, включая режимы масштабирования с коротким, длинным обучением и обучением с подкреплением (RL). В его основе лежит Kimi Delta Attention (KDA) — усовершенствованная версия Gated DeltaNet, которая представляет более эффективный механизм вентилирования для оптимизации использования памяти RNN с конечным состоянием. Kimi Linear обеспечивает превосходную производительность и эффективность оборудования, особенно для задач с длинным контекстом. Это снижает потребность в больших кэшах KV до 75 % и повышает пропускную способность декодирования до $6times$ для контекстов длиной до 1 млн токенов. Мы открываем исходный код ядра KDA в FLA и выпускаем две версии контрольных точек модели, обученных с помощью токенов 5.7T. — Внимание Дельты Кими (KDA): механизм линейного внимания, который совершенствует…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: moonshotai
Теги: kimi_linear, conversational, custom_code
Лайков: 547 | Загрузок: 37,288
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.