keyfan/Qwen-72B-Chat-2bit - Каталог нейросетей
Генерация текста

keyfan/Qwen-72B-Chat-2bit

Добавлено:
keyfan/Qwen-72B-Chat-2bit

Это 2-битное квантование Qwen/Qwen-72B-Chat с использованием QuIP#. Для задач, связанных с китайским языком, вместо этого используйте ветку zh, которая использует двуязычный текст из C4 и SkyPile в качестве калибровочных данных. В качестве альтернативы вы можете использовать ветку vLLM для более быстрого вывода. QuIP должен запускать около 5 ядер для каждого линейного уровня, поэтому для vLLM очень полезно использовать cuda-graph, чтобы уменьшить накладные расходы на запуск. Кстати, если у вас возникли проблемы с установкой fast-adamard-transform из pip, вы также можете установить его из исходного кода. Задержка и пропускная способность измеряются с использованием vLLM (examples/benchmarklatency.py и example/benchmarkthroughput.py соответственно) на одном A100-80G.

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: keyfan
Теги: qwen, custom_code, QUiP
Лайков: 7  |  Загрузок: 10

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.