Этот GGUF сочетает в себе интеллектуальное квантование IQ4NL Qwen3.6-27B с головкой MTP (многотокенное предсказание), взятой из сборки unsloth IQ4XS MTP, что обеспечивает встроенное спекулятивное декодирование при компактном размере файла. Оптимизирован для графических процессоров с видеопамятью 16 ГБ (RTX 4060 Ti 16 ГБ, RTX 4070 Ti Super, RX 7800 XT и т. д.). Это не чистое квантование. Он использует интеллектуальный микс, который назначает различные уровни точности на основе чувствительности тензора: — Тело (851 тензор): квантование интеллектуального микса с использованием иматрицы unsloth для калибровки. Критические тензоры FFN и SSM на IQ4NL, проекции внимания на Q4K, проекции вверх FFN на IQ4XS. — Головка MTP (15 тензоров): извлечена из unsloth/Qwen3.6-27B-MTP-GGUF (вариант IQ4XS), сохраняя исходное смешанное квантование для оптимального принятия спекулятивного декодирования. Чистый GGUF Ununnilium удаляет тензоры MTP для экономии места, но это означает, что спекулятивное декодирование не может использовать обученную собственную черновую головку. Этот файл снова вставляет головку MTP, восстанавливая собственное спекулятивное декодирование MTP, сохраняя при этом интеллектуальную комбинацию квантования, которая отдает приоритет качеству там, где это наиболее важно. — Базовая модель: Qwen/Qwen3.6-27B — Квантование тела: Ununnilium/Qwen3.6-27B-IQ4XS-pure-GGUF — Головной источник MTP:…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: GianniDPC
Теги: gguf, qwen3.6, qwen35, mtp, speculative-decoding, imatrix, conversational, endpoints_compatible
Лайков: 5 | Загрузок: 320
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.