Исходная модель: https://huggingface.co/allura-forge/Llama-3.3-8B-Instruct Все кванты созданы с использованием опции imatrix с набором данных отсюда в сочетании с подмножеством Combinallsmall.parquet от Эда Аддарио здесь — llama.cpp — LM Studio — koboldcpp — Jan AI — Веб-интерфейс генерации текста — LoLLMs Некоторые из этих квантов (Q3KXL, Q4KL и т. д.) являются стандартными. метод квантования, в котором вложения и выходные веса квантуются до Q8_0 вместо того, что обычно используется по умолчанию. Если модель больше 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, запустите: Вы можете либо указать новый локальный каталог (allura-forgeLlama-3.3-8B-Instruct-Q80), либо загрузить их все на месте (./). Раньше вы загружали Q4044/48/8_8, и их веса чередовались в памяти, чтобы повысить производительность на машинах ARM и AVX за счет загрузки большего количества данных за один проход. Однако сейчас существует так называемая «онлайн-переупаковка» весов. подробности в этом PR. Если вы используете Q4_0 и ваше оборудование выиграет от переупаковки весов, оно сделает это автоматически на лету. Начиная с сборки llama.cpp b4282, вы не сможете запускать файлы Q40XX и…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: bartowski
Теги: gguf, endpoints_compatible, conversational
Лайков: 27 | Загрузок: 3,161
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.