Чат Эти файлы были квантованы с использованием оборудования, любезно предоставленного Massed Compute. Модель(и) AWQ для вывода GPU. Модели GPTQ для вывода GPU с несколькими вариантами параметров квантования. 2, 3, 4, 5, 6 и 8-битные модели GGUF для вывода GPU Оригинальная неквантованная модель fp16 Джона Смита в формате pytorch, для вывода GPU и для дальнейших преобразований Эти модели GPTQ, как известно, работают в следующих серверах вывода/webuis. — text-generation-webui — KoboldAI United — LoLLMS Web UI — Hugging Face Text Generation Inference (TGI) Это может быть не полный список; если вы знаете других, пожалуйста, дайте мне знать! Предусмотрено несколько параметров квантования, чтобы вы могли выбрать лучший для вашего оборудования и…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: TheBloke
Теги: llama, not-for-all-audiences, en, text-generation-inference, 4-bit, gptq
Лайков: 3 | Загрузок: 11
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.