> Квантование GPTQ INT4 Qwen/Qwen3.6-27B. > в 3 раза меньше. ~2,4× быстрее. Однопоточное измерение на том же оборудовании, идентичный запрос (337 входных / 42 выходных токена): INT4 обеспечивает ~2,4× большую пропускную способность и ~2,4× меньшую задержку в однопоточном режиме — экономия полосы пропускания за счет 4-битных весов почти 1:1 приводит к ускорению времени декодирования (выходной ток/с и TPOT). Кодировщик изображения (model.visual.) намеренно оставлен в BF16 — квантуются только веса языковой модели. — Вес: 18 ГБ на диске · ~14 ГБ видеопамяти при нагрузке — Совместимость с одним графическим процессором: удобно помещается на потребительскую карту емкостью 24 ГБ (RTX 3090/4090) для короткого и среднего контекста — Длинный контекст (64 тыс.+ токенов): рекомендуется H100 80 ГБ или A100 80 ГБ Наследует лицензию базовой модели. Условия см. на странице модели Qwen/Qwen3.6-27B.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: AxisQuant
Теги: qwen3_5, image-text-to-text, quantized, gptq, int4, 4bit, gptqmodel, qwen
Лайков: 5 | Загрузок: 4,496
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.