> Семейство адаптивного квантования для гибридной архитектуры Qwen3.5-9B Gated DeltaNet + Full Attention. Каждый вариант использует реальные данные иматрицы для выборочного назначения точности для каждого тензора. Модель: empero-ai/Qwable-9B-Claude-Fable-5 — Клод Fable 5 рассуждает о тонкой настройке Qwen3.5-9B. > Примечание. Файл модели SHQ8-Q5KM.gguf назван в честь совместимости с ВЧ-анализатором. Это НЕ чистое квантование Q5KM — это гибрид, использующий базу Q5KM с Q80, Q5K, Q4_K и F16, выборочно применяемыми к различным типам тензоров. Проверьте конфигурацию на предмет точных типов каждого тензора. > Примечание: SHQ8-v2-Q5KM.gguf также является гибридом — база Q5KM с Q80 для критического внимания, Q6K для среднего внимания, IQ4XS для тензоров низкой важности. См. configs/SHQ8v2.sh для получения точной карты для каждого тензора. Скорость: ~22 токена/сек на GTX 1070 (8 ГБ видеопамяти) с флэш-атакой для SHQ-OptA, ~26 токенов/сек для SHQ8-v2 (меньше тензоров Q8_0 → меньше данных через PCIe Pascal). > Я приложил немало усилий, чтобы вручную настроить эти кванты — дайте мне знать, как они работают на вашем оборудовании! Оставьте комментарий или откройте обсуждение с вашей настройкой и любыми отзывами. SHQ-OptA – чемпион качества (лучший PPL). SHQ8-v2 — чемпион по компактности (на 18 % меньше, чем OptA, +0,081 PPL). База Q5KM + Q80…
Модальности:
Генерация текста
Области применения:
Генерация кода Диалог / чат
Задача: Генерация текста
Автор: wepiqx
Теги: gguf, qwen, qwen3.5, 9b, quantized, quantization, llama-cpp, q5_k_m
Лайков: 5 | Загрузок: 476
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.