Чат и поддержка: сервер Discord TheBloke Хотите внести свой вклад? Страница TheBloke на Patreon Работа TheBloke в области LLM щедро поддерживается грантом от Андреессена Горовица (a16z). Этот репозиторий содержит экспериментальную 4-битную модель GPTQ для Falcon-40B-Instruct. 4-битная модель GPTQ для вывода графического процессора 3-битная модель GPTQ для вывода графического процессора 2, 3, 4, 5, 6, 8-битные модели GGML для вывода CPU+GPU Неквантованная модель fp16 в формате pytorch для вывода графического процессора и дальнейших преобразований. Обратите внимание, что это экспериментальная модель GPTQ. В настоящее время его поддержка весьма ограничена. Также ожидается, что это будет ОЧЕНЬ МЕДЛЕННО. В настоящее время это неизбежно, но рассматривается. Для загрузки этой 4-битной модели требуется не менее 35 ГБ видеопамяти. Его можно использовать на картах емкостью 40 или 48 ГБ, но не меньше. Имейте в виду, что в настоящее время вы должны ожидать около 0,7 токенов/с на 40B Falcon GPTQ. AutoGPTQ предоставляет предварительно скомпилированные колеса для Windows и Linux с набором инструментов CUDA 11.7 или 11.8. Если вы используете набор инструментов CUDA 12.x, вам нужно будет скомпилировать свой собственный, следуя этим инструкциям: Для выполнения этих действий вручную потребуется установить набор инструментов Nvidia CUDA. В text-generation-webui имеется временная поддержка AutoGPTQ. Этот…
Модальности:
Генерация текста
Области применения:
Следование инструкциям
Задача: Генерация текста
Автор: TheBloke
Теги: RefinedWeb, custom_code, en, text-generation-inference, 4-bit, gptq
Лайков: 197 | Загрузок: 228
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.