Это 4-битное квантование gptq этой модели: https://huggingface.co/kaiokendev/SuperCOT-LoRA. Это квантование было выполнено с использованием этого репозитория: https://github.com/qwopqwop200/GPTQ-for-LLaMa/tree/triton. Я использовал ветку triton со всеми доступными реализациями gptq (truesequential + acter + groupsize 128). CUDAVISIBLEDEVICES=0 python llama.py ./llama-13b-SuperCOT-4bit-TRITON c4 —wbits 4 —true-sequential —act-order —groupsize 128 —save_safetensors llama-13b-SuperCOT-4bit-TRITON.safetensors Чтобы использовать модель тритона на веб-интерфейсе oobabooga, вы можете обратиться к этому сообщению чтобы избавиться от всех ошибок, с которыми вы можете столкнуться: https://github.com/oobabooga/text-generation-webui/issues/734
Модальности:
Генерация текста
Задача: Генерация текста
Автор: TheYuriLover
Теги: llama, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 14
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.