Чат Эти файлы были квантованы с использованием оборудования, любезно предоставленного Massed Compute. Модель(и) AWQ для вывода GPU. Модели GPTQ для вывода GPU с несколькими вариантами параметров квантования. 2, 3, 4, 5, 6 и 8-битные модели GGUF для вывода GPU nRuaif оригинальная бесчисленная модель fp16 в формате pytorch, для вывода GPU и для дальнейших преобразований модели GPTQ в настоящее время поддерживаются в Linux (NVidia/AMD) и Windows (только NVidia). пользователи macOS: используйте модели GGUF. Эти модели GPTQ, как известно, работают в следующих серверах вывода/webuis. — text-generation-webui — KoboldAI United — LoLLMS Web UI — Hugging Face Text Generation Inference (TGI) Это может быть не полный список; если вы знаете других, пожалуйста…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: TheBloke
Теги: llama, text-generation-inference, 4-bit, gptq
Лайков: 3 | Загрузок: 31
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.