Оригинальная модель: https://huggingface.co/TheSkullery/L3.3-exp-unnamed-model-70b-v0.5 Запустите их напрямую с помощью llama.cpp или любого другого проекта на основе llama.cpp Некоторые из этих квантов (Q3KXL, Q4KL и т. д.) являются стандартным методом квантования с вложениями и выходными весами, квантованными до Q8_0 вместо того, что они обычно используют по умолчанию. Если размер модели превышает 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, выполните команду: Вы можете указать новый local-dir (TheSkulleryL3.3-exp-unnamed-model-70b-v0.5-Q80) или загрузить их все на месте (./) Раньше вы загружали Q4044/48/8_8, и их веса перемежались в памяти, чтобы повысить производительность на машинах ARM и AVX, загружая больше данных за один проход. Теперь, однако, есть то, что называется «онлайн-переупаковка» для весов. подробности в этом PR. Если вы используете Q4_0, и ваше оборудование выиграет от переупаковки весов, оно будет делать это автоматически на лету. Начиная со сборки b4282 llama.cpp, вы не сможете запускать файлы Q40XX, вместо этого вам нужно будет использовать Q40. Кроме того, если вы хотите получить немного лучшее качество для , вы можете использовать IQ4NL благодаря этому PR…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: bartowski
Теги: gguf, merge, endpoints_compatible, imatrix, conversational
Лайков: 3 | Загрузок: 1,550
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.