Это 2-битное квантование Qwen/Qwen-72B-Chat с использованием QuIP#. Для задач, связанных с китайским языком, вместо этого используйте ветку zh, которая использует двуязычный текст из C4 и SkyPile в качестве калибровочных данных. В качестве альтернативы вы можете использовать ветку vLLM для более быстрого вывода. QuIP должен запускать около 5 ядер для каждого линейного уровня, поэтому для vLLM очень полезно использовать cuda-graph, чтобы уменьшить накладные расходы на запуск. Кстати, если у вас возникли проблемы с установкой fast-adamard-transform из pip, вы также можете установить его из исходного кода. Задержка и пропускная способность измеряются с использованием vLLM (examples/benchmarklatency.py и example/benchmarkthroughput.py соответственно) на одном A100-80G.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: keyfan
Теги: qwen, custom_code, QUiP
Лайков: 7 | Загрузок: 10
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.