caiovicentino1/Qwopus3.5-9B-v3-HLWQ-Q5 - Каталог нейросетей
Генерация текста

caiovicentino1/Qwopus3.5-9B-v3-HLWQ-Q5

Добавлено:
caiovicentino1/Qwopus3.5-9B-v3-HLWQ-Q5

> [!ВАЖНО] > Уведомление об именовании (10 апреля 2026 г.). Метод «HLWQ», используемый в этой модели, переименовывается в HLWQ (Весовое квантование по Адамару-Ллойду). Изменение касается только имени; алгоритм и веса в этом репозитории не изменились. > > Ребрендинг устраняет конфликт имен с несвязанным, более ранним методом квантования кэша KV, также называемым HLWQ (Han et al., arXiv:2502.02617, 2025). HLWQ обеспечивает весовое квантование с помощью детерминированного вращения Уолша-Адамара и скалярной кодовой книги Ллойда-Макса; HLWQ Хана и др. касается квантования KV-кеша со случайным вращением полярностей. Эти два метода технически различны. > > Существующие загрузчики, загружающие этот репозиторий по ID, продолжают работать без изменений. В будущих загрузках моделей будет использоваться имя HLWQ. > > Справочный документ по этой методике: arXiv:2603.29078 (версия 2 находится в стадии подготовки; версия 1 все еще использует старое имя). > Гибридная модель 9B (архитектура Qwen3.5), квантованная до INT4 с калибровкой GPTQ. Загружается изначально в vLLM с ядром Marlin. 113 ток/с на RTX 3090. > Нашли оптимальную конфигурацию: groupsize=64 + FOEM = 67,07% HumanEval (против 66,87% BF16) > > 👉 Скачать HLWQ v7 (gs64+FOEM)** — то же ядро ​​Marlin, 8,7 ГБ Ранее наивный INT4 забил…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: caiovicentino1
Теги: qwen3_5, hlwq, gptq, int4, qwen3.5, vllm, marlin, conversational
Лайков: 9  |  Загрузок: 66

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.