Вы можете запустить его на графическом процессоре с памятью 11 ГБ, используя базовый метод квантования QuIP#, метод квантования только с весами, который позволяет достичь производительности, близкой к fp16, используя только 2 бита на вес. URL: https://github.com/Cornell-RelaxML/quip-sharp/tree/release20231203
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Minami-su
Теги: llama, 2bit, yi, 34b, conversational, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 8
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.