Это 2-битное квантование mistralai/Mixtral-8x7B-Instruct-v0.1 с использованием QuIP#. В качестве альтернативы вы можете использовать ветку vLLM для более быстрого вывода. QuIP должен запускать около 5 ядер для каждого линейного уровня, поэтому для vLLM очень полезно использовать cuda-graph, чтобы уменьшить накладные расходы на запуск. Кстати, если у вас возникли проблемы с установкой fast-adamard-transform из pip, вы также можете установить его из исходного кода. Измерено с помощью скрипта example/benchmarklatency.py` в репозитории vLLM. При размере пакета = 1 он генерирует 16,3 токена/с с одним 3090.
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: keyfan
Теги: mixtral, conversational, en, text-generation-inference, endpoints_compatible, QUiP
Лайков: 4 | Загрузок: 13
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.