Это репозиторий экспериментальных GGUF для серверной независимой реализации поддержки модели Kimi-Linear, для которой требуется llama.cpp из этого репозитория. Вы можете git клонировать его и скомпилировать локально. Если у вас достаточно видеопамяти, вы можете запустить ее исключительно на своей видеокарте: в противном случае вы можете загрузить только общие эксперты и кэш KV на свою видеокарту, а остальное — в ЦП и ОЗУ. Я собираюсь создавать только ggufs без imatrix и ggufs с imatrix на основе c4enja_imatrix.txt для лучшей японской производительности, поскольку bartowski и unsloth в любом случае будут создавать ggufs с английским imatrix. Похоже, что кеш MLA KV может быть запущен только при нажатии F16, вероятно, из-за того, что он является своего рода сжатием. Вы можете использовать эту таблицу, чтобы увидеть, какой объем контекста вы можете запустить с одной картой емкостью 24 ГБ. Как и ожидалось, imatrix не влияет на MXFP4MOE. Судя по этой ветке Reddit, его недоумение примерно такое же, как у IQ4XS, но размер файла примерно на 6% больше. Здесь его растерянность лучше, чем у IQ4_XS. Это делает его жизнеспособным вариантом.
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: ymcki
Теги: gguf, en, endpoints_compatible, conversational
Лайков: 37 | Загрузок: 568
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.