mlx-community/Kimi-K2.6-mlx-DQ3_K_M-q8 - Каталог нейросетей
Генерация текста

mlx-community/Kimi-K2.6-mlx-DQ3_K_M-q8

Добавлено:
mlx-community/Kimi-K2.6-mlx-DQ3_K_M-q8

Эта модель mlx-community/Kimi-K2.6-mlx-DQ3KM-q8 была конвертирована в формат MLX из Moonshotai/Kimi-K2.6 с использованием mlx-lm версии 0.31.2. После успеха первой модели Kimi «DQ3KM» и K2.5, это новое обновление для Kimi-K2.6! Это создано для людей, использующих один Apple Mac Studio M3 Ultra с 512 ГБ. 4-битная версия Кими К2 не подходит. Используя результаты исследований, мы стремимся получить 4-битную производительность за счет немного меньшего и более разумного квантования. Оно также не должно быть настолько большим, чтобы не оставлять памяти для полезного контекстного окна. Больше похожих квантов модели MLX для Apple Mac Studio с 512 ГБ можно найти по адресу https://huggingface.co/bibproj. Рецепт тот же, что и для модели K2.5. Оба немного отличаются от первой модели Кими «DQ3KM», которая была описана там. Чтобы квант работал лучше в условиях стресса, только экспертные тензоры квантуются в смесь 3-битных и 4-битных. Все остальные тензоры остаются 8-битными. Можно сказать, что у этого кванта 8-битный «мозг» и 3-битные/4-битные эксперты. Размеры всех трех этих квантов примерно одинаковы. 8-битная маршрутизация уменьшает количество токенов в секунду на несколько %. Вы получите немного медленнее TG, но лучше…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: mlx-community
Теги: mlx, kimi_k25, image-feature-extraction, conversational, custom_code, 4-bit
Лайков: 8  |  Загрузок: 57,422

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.