Эта модель mlx-community/Kimi-K2.6-mlx-DQ3KM-q8 была конвертирована в формат MLX из Moonshotai/Kimi-K2.6 с использованием mlx-lm версии 0.31.2. После успеха первой модели Kimi «DQ3KM» и K2.5, это новое обновление для Kimi-K2.6! Это создано для людей, использующих один Apple Mac Studio M3 Ultra с 512 ГБ. 4-битная версия Кими К2 не подходит. Используя результаты исследований, мы стремимся получить 4-битную производительность за счет немного меньшего и более разумного квантования. Оно также не должно быть настолько большим, чтобы не оставлять памяти для полезного контекстного окна. Больше похожих квантов модели MLX для Apple Mac Studio с 512 ГБ можно найти по адресу https://huggingface.co/bibproj. Рецепт тот же, что и для модели K2.5. Оба немного отличаются от первой модели Кими «DQ3KM», которая была описана там. Чтобы квант работал лучше в условиях стресса, только экспертные тензоры квантуются в смесь 3-битных и 4-битных. Все остальные тензоры остаются 8-битными. Можно сказать, что у этого кванта 8-битный «мозг» и 3-битные/4-битные эксперты. Размеры всех трех этих квантов примерно одинаковы. 8-битная маршрутизация уменьшает количество токенов в секунду на несколько %. Вы получите немного медленнее TG, но лучше…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: mlx-community
Теги: mlx, kimi_k25, image-feature-extraction, conversational, custom_code, 4-bit
Лайков: 8 | Загрузок: 57,422
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.