LMDeploy поддерживает вывод модели LLM с 4-разрядным весом, при этом минимальное требование для видеокарт NVIDIA — sm80. Прежде чем приступить к выводу, убедитесь, чтоlmdeploy (>= v0.0.4) установлен. Вы можете загрузить предварительно квантованные 4-разрядные весовые модели из модельного зоопарка LMDeploy и выполнить вывод с помощью следующей команды. В качестве альтернативы вы можете квантовать 16-разрядные веса до 4-разрядных весов, следуя разделу «4-разрядная квантование веса», а затем выполнить вывод в соответствии с приведенными ниже инструкциями. Возьмите 4-разрядную модель Llama-2-7B из модельного зоопарка в качестве примера: Как показано в приведенной ниже команде, сначала преобразуйте макет модели с помощью turbomind.deploy, а затем вы можете взаимодействовать с помощником AI в терминале. Если вы хотите взаимодействовать с моделью через веб-интерфейс, пожалуйста, запустите сервер gradio, как указано ниже: Впоследствии вы можете открыть веб-сайт http://{ipaddr}:{port}` в своем браузере и взаимодействовать с моделью. Мы сравнили Llama 2 7B и 13B С И мы измеряем пропускную способность генерации токенов (токенов/с), устанавливая один токен подсказки и генерируя 512 токенов. Все…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: lmdeploy
Теги: llama, text-generation-inference, endpoints_compatible
Лайков: 3 | Загрузок: 14
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.