— биты: 4 — размер группы: 128 — descact: true — staticgroups: false — sym: true — lmhead: false — dumppercent: 0.01 — truesequential: true — modelnameorpath: «» — modelfilebasename: «model» — quantmethod: «gptq» — checkpointformat: «gptq» — мета: — квантователь: «gptqmodel:0.9.9-dev0» В настоящее время только vllm может загрузить квантованную gemma2-27b для правильного вывода. Вот пример:
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: ModelCloud
Теги: gemma2, gptq, 4bit, gptqmodel, modelcloud, conversational, text-generation-inference, endpoints_compatible
Лайков: 12 | Загрузок: 229
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.