Оригинальная модель: https://huggingface.co/ArliAI/Llama-3.1-70B-ArliAI-RPMax-v1.3 Некоторые из этих квантов (Q3KXL, Q4KL и т. д.) являются стандартным методом квантования с вложениями и выходными весами, квантованными до Q8_0 вместо того, что они обычно по умолчанию. Если размер модели превышает 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, выполните команду: Вы можете указать новый local-dir (Llama-3.1-70B-ArliAI-RPMax-v1.3-Q8_0) или загрузить их все на месте (./) Это НЕ для разгрузки Metal (Apple) или GPU (nvidia/AMD/intel), только чипы ARM (и некоторые процессоры AVX2/AVX512). Если вы используете чип ARM, кванты Q40XX будут иметь существенное ускорение. Проверьте сравнение скорости Q4044 в исходном запросе на вытягивание. Чтобы узнать, какой из них лучше всего подойдет для вашего чипа ARM, вы можете проверить функции SoC AArch64 (спасибо EloyOn!). Если вы используете процессор, который поддерживает AVX2 или AVX512 (обычно серверные процессоры и новейшие процессоры AMD Zen5), и не разгружаетесь на графический процессор, Q408_8 также может предложить хорошую скорость: Q408_8 предлагает хороший удар для быстрой обработки и небольшой удар для генерации текста.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: bartowski
Теги: gguf, endpoints_compatible, imatrix, conversational
Лайков: 4 | Загрузок: 515
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.