Конвертированная модель из https://huggingface.co/lmsys/vicuna-13b-delta-v1.1 (Экспериментальная функция: вы можете указать —style rich, чтобы включить расширенный текстовый вывод и улучшить качество потоковой передачи текста для некоторого контента, отличного от ASCII. Это может работать неправильно на некоторых терминалах.) Для приведенной ниже команды требуется около 28 ГБ памяти графического процессора для Vicuna-13B и 14 ГБ памяти графического процессора для Vicuna-7B. Если у вас недостаточно памяти, см. раздел «Недостаточно памяти» ниже. Вы можете использовать параллелизм моделей для объединения памяти графического процессора из нескольких графических процессоров на одном компьютере. Это работает только на процессоре и не требует графического процессора. Для этого требуется около 60 ГБ памяти ЦП для Vicuna-13B и около 30 ГБ памяти ЦП для Vicuna-7B. Используйте —device mps, чтобы включить ускорение графического процессора на компьютерах Mac (требуется torch >= 2.0). Используйте —load-8bit, чтобы включить 8-битное сжатие. Vicuna-7B может работать на Macbook M1 емкостью 32 ГБ со скоростью 1–2 слова в секунду. Если вам недостаточно памяти, вы можете включить 8-битное сжатие, добавив —load-8bit к командам выше. Это может сократить использование памяти примерно вдвое, но при этом слегка ухудшится качество модели. Он совместим с процессором, графическим процессором и серверной частью Metal. Vicuna-13B с 8-битным сжатием может работать на одном процессоре NVIDIA…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: jinxuewen
Теги: llama, text-generation-inference
Лайков: 6 | Загрузок: 5
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.