TheYuriLover/llama-13b-SuperCOT-4bit-TRITON - Каталог нейросетей
Генерация текста

TheYuriLover/llama-13b-SuperCOT-4bit-TRITON

Добавлено:
TheYuriLover/llama-13b-SuperCOT-4bit-TRITON

Это 4-битное квантование gptq этой модели: https://huggingface.co/kaiokendev/SuperCOT-LoRA. Это квантование было выполнено с использованием этого репозитория: https://github.com/qwopqwop200/GPTQ-for-LLaMa/tree/triton. Я использовал ветку triton со всеми доступными реализациями gptq (truesequential + acter + groupsize 128). CUDAVISIBLEDEVICES=0 python llama.py ./llama-13b-SuperCOT-4bit-TRITON c4 —wbits 4 —true-sequential —act-order —groupsize 128 —save_safetensors llama-13b-SuperCOT-4bit-TRITON.safetensors Чтобы использовать модель тритона на веб-интерфейсе oobabooga, вы можете обратиться к этому сообщению чтобы избавиться от всех ошибок, с которыми вы можете столкнуться: https://github.com/oobabooga/text-generation-webui/issues/734

Модальности:
Генерация текста


Задача: Генерация текста
Автор: TheYuriLover
Теги: llama, text-generation-inference, endpoints_compatible
Лайков: 4  |  Загрузок: 14

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.