internlm/internlm-chat-20b-4bit - Каталог нейросетей
Генерация текста

internlm/internlm-chat-20b-4bit

Добавлено:
internlm/internlm-chat-20b-4bit

LMDeploy поддерживает вывод модели LLM с 4-битным весом, при этом минимальным требованием для видеокарт NVIDIA является sm80, например A10, A100, серии Geforce 30/40. Прежде чем приступить к выводу internlm-chat-20b-4bit, убедитесь, что lmdeploy установлен. Как показано в приведенной ниже команде, сначала преобразуйте макет модели с помощью Turbomind.deploy, а затем вы сможете взаимодействовать с AI-помощником в терминале. Если вы хотите взаимодействовать с моделью через веб-интерфейс, запустите сервер Gradio, как указано ниже: Впоследствии вы можете открыть веб-сайт http://{ipaddr}:{port}` в своем браузере и взаимодействовать с моделью. Помимо подачи с градиентом, есть еще два метода подачи. Один обслуживается сервером вывода Triton (TIS), а другой представляет собой сервер, подобный OpenAI, с именем apiserver`. Если вам интересно, обратитесь к руководству пользователя для получения подробной информации. LMDeploy предоставляет сценарии для сравнительного анализа пропускной способности токена и пропускной способности запросов. Пропускная способность токена проверяет скорость генерации новых токенов при заданном количестве токенов подсказки и токенов завершения, а пропускная способность запросов измеряет количество запросов, обрабатываемых в минуту с реальными…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: internlm
Теги: internlm, feature-extraction, custom_code
Лайков: 24  |  Загрузок: 10

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.