keyfan/Mixtral-8x7B-Instruct-2bit - Каталог нейросетей
Генерация текста

keyfan/Mixtral-8x7B-Instruct-2bit

Добавлено:
keyfan/Mixtral-8x7B-Instruct-2bit

Это 2-битное квантование mistralai/Mixtral-8x7B-Instruct-v0.1 с использованием QuIP#. В качестве альтернативы вы можете использовать ветку vLLM для более быстрого вывода. QuIP должен запускать около 5 ядер для каждого линейного уровня, поэтому для vLLM очень полезно использовать cuda-graph, чтобы уменьшить накладные расходы на запуск. Кстати, если у вас возникли проблемы с установкой fast-adamard-transform из pip, вы также можете установить его из исходного кода. Измерено с помощью скрипта example/benchmarklatency.py` в репозитории vLLM. При размере пакета = 1 он генерирует 16,3 токена/с с одним 3090.

Модальности:
Генерация текста

Области применения:
Диалог / чат Следование инструкциям


Задача: Генерация текста
Автор: keyfan
Теги: mixtral, conversational, en, text-generation-inference, endpoints_compatible, QUiP
Лайков: 4  |  Загрузок: 13

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.