Этот LoRA обучался в течение 3 эпох и был преобразован в int4 (4 бита) с помощью метода GPTQ. Используйте одну из двух версий Safetensor. Версия pt — это старая версия квантования, которая больше не поддерживается и будет удалена в будущем. Убедитесь, что у вас есть только ОДНА контрольная точка из двух в каталоге вашей модели! Дополнительную информацию смотрите в репозитории ниже. Недавние коммиты GPTQ внесли критические изменения в загрузку модели, и вам следует использовать этот форк для стабильной работы https://github.com/oobabooga/GPTQ-for-LLaMa. Существует также квантованная модель без размера группы, размер которой на 1 ГБ меньше, что должно позволять работать с максимальными маркерами контекста с 24 ГБ видеопамяти. Оценки лучше для версии с размером группы 128, но компромиссом является невозможность запускать ее в полном контексте без разгрузки или на графическом процессоре с большим количеством видеопамяти. Добавлены новые веса. Старая версия .pt больше не поддерживается и заменена файлом Safetensors размером 128 групп. Обновите GPTQ до последней версии/webui. 1. Запустите вручную через GPTQ. 2. (Больше настроек, но лучший пользовательский интерфейс) – Используйте файл text-generation-webui. Прежде чем добавлять поддержку GPTQ, обязательно выполните шаги установки, описанные здесь. Поскольку это настроено по инструкции, к лучшему…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: elinas
Теги: llama, alpaca, gptq, text-generation-inference, endpoints_compatible
Лайков: 68 | Загрузок: 18
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.