kimi-k2.6-eagle3-mla — это черновая модель Eagle3 MTP с MLA (Multi-Latent Attention) для ускорения вывода Kimi-K2.6, обученная с помощью TorchSpec — онлайн-среды обучения спекулятивному декодированию, которая одновременно запускает обучение FSDP и вывод. Если этот черновой вариант модели окажется для вас полезным, поставьте звездочку нашему проекту TorchSpec на GitHub. По сравнению с черновой моделью MHA вариант MLA лучше подходит для развертывания Kimi-K2.6: — Использует меньше кэша KV, что снижает нагрузку на обслуживающую память. — Соответствует архитектуре MLA Kimi-K2.6, поэтому более естественно вписывается в обработку KV-кэша механизма вывода в различных сценариях обслуживания, таких как PD-дезагрегация. — Кластер: 3 узла × 8 × B200 (всего 24 графических процессора) — Обучение: 1 узел (8 графических процессоров), FSDP — Вывод: 2 узла (16 графических процессоров), vLLM (TP=8 на узел) — Непрерывное обучение: инициализируется с контрольной точки kimi-k2.5-eagle3-mla — Итерации: 9279 шагов — Скорость обучения: 2e-5, косинусный график. Основной показатель: Acceptlength — среднее количество токенов, принятых за шаг спекуляции с numspeculativetokens=3`. Чем выше, тем лучше.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: lightseekorg
Теги: kimi_k2, speculative-decoding, eagle3, kimi-k2.6, torchspec
Лайков: 6 | Загрузок: 72,200
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.