Исходная модель: https://huggingface.co/TheDrummer/Endurance-100B-v1.1 Некоторые из этих квантов (Q3KXL, Q4KL и т. д.) представляют собой стандартный метод квантования, в котором вложения и выходные веса квантуются до Q8_0 вместо того, что обычно используется по умолчанию. Если модель больше 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, запустите: Вы можете либо указать новый локальный каталог (Endurance-100B-v1.1-Q8_0), либо загрузить их все на месте (./). Новое: Благодаря усилиям, предпринятым для онлайн-переупаковки весов в этом PR, теперь вы можете просто использовать Q4_0, если ваш llama.cpp был скомпилирован для вашего ARM-устройства. Точно так же, если вы хотите получить немного лучшую производительность, вы можете использовать IQ4NL благодаря этому PR, который также переупаковает веса для ARM, но пока только 44. Время загрузки может увеличиться, но это приведет к увеличению общей скорости. Нажмите, чтобы просмотреть информацию о Q40XX. Они НЕ* предназначены для разгрузки Metal (Apple) или графического процессора (nvidia/AMD/intel), только чипов ARM (и некоторых процессоров AVX2/AVX512). Если вы используете чип ARM, кванты Q40XX будут иметь существенное ускорение. Ознакомьтесь со сравнением скорости Q4044 в исходном запросе на включение. Чтобы проверить, какой…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: bartowski
Теги: gguf, endpoints_compatible, imatrix, conversational
Лайков: 5 | Загрузок: 581
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.