LMDeploy поддерживает вывод модели LLM с 4-битным весом, при этом минимальное требование для видеокарт NVIDIA — sm80. Прежде чем приступить к выводу, убедитесь, что установлен lmdeploy(>=v0.0.14). Вы можете загрузить предварительно квантованные 4-битные весовые модели из зоопарка моделей LMDeploy и выполнить вывод, используя следующую команду. В качестве альтернативы вы можете квантовать 16-битные веса в 4-битные веса, следуя разделу «4-битное квантование весов», а затем выполнить вывод в соответствии с инструкциями ниже. В качестве примера возьмем 4-битную модель Llama-2-70B из зоопарка моделей: Как показано в команде ниже, сначала преобразуйте макет модели с помощью Turbomind.deploy, а затем вы сможете взаимодействовать с AI-помощником в терминале. Если вы хотите взаимодействовать с моделью через веб-интерфейс, запустите сервер Gradio, как указано ниже: Впоследствии вы можете открыть веб-сайт http://{ipaddr}:{port}` в своем браузере и взаимодействовать с моделью. Мы протестировали модель Llama 2 7B и 13B с 4-битным квантованием на NVIDIA GeForce RTX 4090 с использованием профиля_генерации.py. И мы измеряем пропускную способность генерации токенов (токен/с), устанавливая один токен приглашения и генерируя 512 токенов. Все…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: lmdeploy
Теги: llama, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 9
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.