Исходная модель: https://huggingface.co/ddh0/Qwen2.5-72B-0.6x-Instruct Некоторые из этих квантов (Q3KXL, Q4KL и т. д.) используют стандартный метод квантизации, при котором эмбеддинги и выходные веса квантуются до Q8_0 вместо обычного значения по умолчанию. Если размер модели превышает 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, выполните команду: Вы можете указать новый local-dir (Qwen2.5-72B-0.6x-Instruct-Q8_0) или загрузить их все на месте (./) Это НЕ для разгрузки Metal (Apple) или GPU (nvidia/AMD/intel), только чипы ARM (и некоторые процессоры AVX2/AVX512). Если вы используете чип ARM, кванты Q40XX будут иметь существенное ускорение. Проверьте сравнение скорости Q4044 в исходном запросе на вытягивание. Чтобы узнать, какой из них лучше всего подойдет для вашего чипа ARM, вы можете проверить функции SoC AArch64 (спасибо EloyOn!). Если вы используете процессор, который поддерживает AVX2 или AVX512 (обычно серверные процессоры и новейшие процессоры AMD Zen5), и не разгружаетесь на графический процессор, Q408_8 также может предложить хорошую скорость: Q408_8 предлагает хороший удар для быстрой обработки и небольшой удар для генерации текста.
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: bartowski
Теги: gguf, chat, en, endpoints_compatible, imatrix, conversational
Лайков: 4 | Загрузок: 527
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.