Чат и поддержка: сервер Discord TheBloke Хотите внести свой вклад? Страница TheBloke на Patreon Работа TheBloke в области LLM щедро поддерживается грантом от Андреессена Горовица (a16z). Этот репозиторий содержит экспериментальную 4-битную модель GPTQ для WizardLM-Uncensored-Falcon-7B Эрика Хартфорда. 4-битная модель GPTQ для вывода на основе графического процессора. 2, 3, 4, 5, 6 и 8-битные модели GGML для вывода на основе процессора и графического процессора. * Неквантованная модель bf16 Эрика в формате pytorch для вывода на основе графического процессора и дальнейших преобразований. Обратите внимание, что это экспериментальная модель GPTQ. В настоящее время его поддержка весьма ограничена. Ожидается также, что он будет МЕДЛЕННЫМ. В настоящее время это неизбежно, но рассматривается. AutoGPTQ предоставляет предварительно скомпилированные колеса для Windows и Linux с набором инструментов CUDA 11.7 или 11.8. Если вы используете набор инструментов CUDA 12.x, вам нужно будет скомпилировать свой собственный, следуя этим инструкциям: Для выполнения этих действий вручную потребуется установить набор инструментов Nvidia CUDA. В text-generation-webui имеется временная поддержка AutoGPTQ. Для этого требуется text-generation-webui на момент фиксации 204731952ae59d79ea3805a425c73dd171d943c3. Поэтому сначала обновите text-genration-webui до последней версии. 1. Запустите text-generation-webui 2. Нажмите «Модель…»
Модальности:
Генерация текста
Задача: Генерация текста
Автор: TheBloke
Теги: RefinedWebModel, custom_code, text-generation-inference, endpoints_compatible, 4-bit, gptq
Лайков: 70 | Загрузок: 57
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.