Полный набор турбо-квантовых GGUF с ротацией WHT для Qwen/Qwen3.6-27B, квантованных с помощью иматричной калибровки на данных кодирования Python. Кванты дня выпуска. Турбо-кванты используют вращение преобразования Уолша-Адамара перед квантованием, что значительно снижает ошибку квантования по сравнению со стандартными квантовами GGUF при той же разрядности. TQ31S и TQ41S стабильно превосходят свои аналоги в Q4/Q5. TQ10 и TQ20 используют тернаризацию и превосходят стандартные форматы IQ1/IQ2. Квантизировано с использованием специальной вилки llama.cpp с оптимизированной поддержкой ядра ROCm/HIP TQ. Imatrix откалиброван на ~1500 примерах кодирования Python, взятых из: — ajibawa-2023/Python-Code-23k-ShareGPT — iamtarun/pythoncodeinstructions18kalpaca — Flytech/python-codes-25k bash llama-server —model Qwen3.6-27B-TQ41S.gguf -ngl 999 —ctx-size 32768 —cache-type-k q80 —cache-type-v q80 —flash-attn —no-mmap Qwen3.6-27B использует общий токенизатор (n_vocab=248320) и семейство архитектуры (qwen35) с моделями Qwen3.5, что делает их совместимыми для спекулятивного декодирования. Соедините с черновой моделью Qwen3.5 для ускоренного вывода: llama-server —model Qwen3.6-27B-TQ41S.gguf —model-draft Qwen3.5-9B-TQ31S.gguf -ngl 999 -ngld 999 —parallel 1 —draft-max…
Модальности:
Генерация текста
Области применения:
Генерация кода Диалог / чат
Задача: Генерация текста
Автор: mad-lab-ai
Теги: gguf, quantized, tq1_0, tq2_0, tq3_1s, tq4_1s, turbo-quant, llama.cpp
Лайков: 5 | Загрузок: 351
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.