Мы искренне благодарим разработчиков и участников сообщества открытого исходного кода unsloth и ubergarm за предоставление BF16 и iMatrix. IQ1M создан по рецептам тензорного типа и служит только в качестве экспериментальной конфигурации для экстремального сжатия. Q2KXL — это специализированная версия со всеми экспертными 2-битными и всеми остальными тензорами в 8-битной версии, предназначенная для индивидуального развертывания и экспериментов. Q80-Q40 [Q4X] — это почти «полноценная» версия с исправлением взлома Q40, предоставленным jukofyork. Окончательная оценка: PPL = 2,0813 +/- 0,00903. Q3KXL получен из варианта Q4X, при этом все эксперты ffngate и ffnup квантованы до 3 битов. [рекомендуется, если вам не подходит версия Q4X]. Для сверхбольших моделей MoE, таких как Kimi, компонентом, который доминирует в использовании VRAM/RAM, является сам экспертный блок. Поэтому наше квантование фокусируется в первую очередь на этой важной части, без применения дополнительного точного микширования attn или sheexp. > Загрузка Доступна для HuggingFaceHub, HuggingFace-Cli, SnapshotDownload, Xet. Пример запуска gguf с локальной сборкой llama.cpp. (llama-cli/llama-server) Этот репозиторий основан на выдающихся работах следующих авторов и проектов с открытым исходным кодом: — Moonshotai/Kimi-K2-Thinking…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: moxin-org
Теги: gguf, Kimi-K2-Thinking, Kimi, DeepseekV3ForCausalLM, llama.cpp, GGUF, endpoints_compatible, imatrix
Лайков: 9 | Загрузок: 19
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.