Один из них уже есть по адресу https://huggingface.co/anon8231489123/gpt4-x-alpaca-13b-native-4bit-128g, но ни загруженная ими версия triton, ни cuda, похоже, не хотят работать со старыми версиями GPTQ-for-LLaMA, такими как та, которая в настоящее время используется с KoboldAI для поддержки 4 бит на форке 0cc4m. python llama.py ./gpt4-x-alpaca c4 —wbits 4 —true-sequential —groupsize 128 —save_safetensors gpt-x-alpaca-13b-native-4bit-128g-cuda.safetensors
Модальности:
Генерация текста
Задача: Генерация текста
Автор: tsumeone
Теги: llama, text-generation-inference, endpoints_compatible
Лайков: 14 | Загрузок: 38
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.