> [!ВАЖНО] > Уведомление об именовании (10 апреля 2026 г.). Метод «HLWQ», используемый в этой модели, переименовывается в HLWQ (Весовое квантование по Адамару-Ллойду). Изменение касается только имени; алгоритм и веса в этом репозитории не изменились. > > Ребрендинг устраняет конфликт имен с несвязанным, более ранним методом квантования кэша KV, также называемым HLWQ (Han et al., arXiv:2502.02617, 2025). HLWQ обеспечивает весовое квантование с помощью детерминированного вращения Уолша-Адамара и скалярной кодовой книги Ллойда-Макса; HLWQ Хана и др. касается квантования KV-кеша со случайным вращением полярностей. Эти два метода технически различны. > > Существующие загрузчики, загружающие этот репозиторий по ID, продолжают работать без изменений. В будущих загрузках моделей будет использоваться имя HLWQ. > > Справочный документ по этой методике: arXiv:2603.29078 (версия 2 находится в стадии подготовки; версия 1 все еще использует старое имя). — Архитектура: Qwen3.5-9B — 32 слоя (гибридное внимание+линейное), 4 КВ-головки, headdim=128 — Весовое квантование: вращение Адамара (128×128) + Lloyd-Max Q5 + torchao INT4 — KV-кэш: вращение Адамара (128×128) + Lloyd-Max Q3 + настоящая битовая упаковка — Потоковый загрузчик**: Помодульный INT4 — подходит для любого графического процессора ≥ 8 ГБ. В отличие от GGUF (унифицированного…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: caiovicentino1
Теги: qwen3_5_text, hlwq, qwen3.5, quantized, kv-cache-compression, conversational, polarengine
Лайков: 5 | Загрузок: 16
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.