tsumeone/llama-30b-supercot-4bit-cuda - Каталог нейросетей
Генерация текста

tsumeone/llama-30b-supercot-4bit-cuda

Добавлено:
tsumeone/llama-30b-supercot-4bit-cuda

Квантованная версия: https://huggingface.co/ausboss/llama-30b-supercot Квантование GPTQ с использованием https://github.com/0cc4m/GPTQ-for-LLaMa для совместимости с форком KoboldAI 0cc4m. В этом варианте нет группировки для экономии видеопамяти, так что вы можете наслаждаться полным максимальным контекстом 2048, если у вас 24 ГБ видеопамяти (или хотя бы подойдите к нему намного ближе по сравнению с версией с размером группы) Оценка и оценка (чем ниже, тем лучше): WikiText2: 4,66 PTB: 17,64 * C4: 6,50 Версия с размером группы находится здесь: https://huggingface.co/tsumeone/llama-30b-supercot-4bit-128g-cuda

Модальности:
Генерация текста


Задача: Генерация текста
Автор: tsumeone
Теги: llama, text-generation-inference, endpoints_compatible
Лайков: 14  |  Загрузок: 7

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.