Thireus/Vicuna13B-v1.1-8bit-128g - Каталог нейросетей
Генерация текста

Thireus/Vicuna13B-v1.1-8bit-128g

Добавлено:
Thireus/Vicuna13B-v1.1-8bit-128g

Это 8-битная версия GPTQ (не путать с 8-битной RTN) версии Vicuna 13B v1.1 HF. Вопрос. Почему квантование производится в 8 бит, а не в 4 бита? А. Для целей оценки. Теоретически, 8-битная квантованная модель должна обеспечивать немного лучшее недоумение (возможно, не заметное — подлежит оценке…) по сравнению с 4-битной квантованной версией. Если объем доступной видеопамяти графического процессора превышает 15 ГБ, вы можете попробовать это. Обратите внимание, что кватизация в 8 бит не означает загрузку модели с 8-битной точностью. Загрузка модели с точностью до 8 бит (—load-in-8bit) приводит к заметному ухудшению качества (недоумению). Ссылки: — https://github.com/ggerganov/llama.cpp/pull/951 — https://news.ycombinator.com/item?id=35148542 — https://github.com/ggerganov/llama.cpp/issues/53 — https://arxiv.org/abs/2210.17323 — https://arxiv.org/abs/2105.03536 — https://arxiv.org/abs/2212.09720 — https://arxiv.org/abs/2301.00774 — https://github.com/IST-DASLab/gptq Эта модель представляет собой 8-битное квантование Vicuna 13Bv1.1. — Параметры 13B — Размер группы: 128 — wbits: 8 — истинная последовательность: да — порядок действий: да — 8-битный GPTQ — c4 — Процесс преобразования: LLaMa 13B -> LLaMa 13B HF -> Vicuna13B-v1.1 HF -> Vicuna13B-v1.1-8bit-128g Использование…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: Thireus
Теги: llama, vicuna, text-generation-inference, endpoints_compatible
Лайков: 16  |  Загрузок: 11

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.