Это квантование MXFP4_MOE модели Kimi-Linear-48B-A3B-Instruct Основным стандартом является использование MXFP4 для тензоров MoE и Q8 для остальных. Поэтому я создал 2 новых варианта, где другими тензорами являются BF16 или FP16 вместо Q8. Порядок предпочтения — BF16, затем F16. На некоторых архитектурах BF16 будет медленнее, но его высочайшее качество, по сути, это оригинальные тензоры из модели, скопированные над неквантованными.
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: noctrex
Теги: gguf, endpoints_compatible, conversational
Лайков: 4 | Загрузок: 108
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.