Должно работать на картах VRAM объемом 12 ГБ в веб-интерфейсе с длиной контекста, установленной на 4096, загрузчиком ExLlamav2HF и кэш8бит = True. Все комментарии очень приветствуются, скачивайте, тестируйте, и если вы цените мою работу, рассмотрите возможность покупки мне моего топлива:
Модальности:
Генерация текста
Задача: Генерация текста
Автор: TeeZee
Теги: llama, merge, not-for-all-audiences, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 24
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.