Оригинальная модель: https://huggingface.co/barty/CodeLlama-13B-MORepair Некоторые из этих квантов (Q3KXL, Q4KL и т. д.) являются стандартным методом квантования с вложениями и выходными весами, квантованными в Q8_0 вместо того, что они обычно используют по умолчанию. Если размер модели превышает 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, выполните команду: Вы можете указать новый local-dir (CodeLlama-13B-MORepair-Q8_0) или загрузить их все на месте (./) Нажмите для просмотра информации Q40XX Это НЕ* для разгрузки Metal (Apple) или GPU (nvidia/AMD/intel), только чипы ARM (и некоторые процессоры AVX2/AVX512). Если вы используете чип ARM, кванты Q40XX будут иметь существенное ускорение. Проверьте сравнение скорости Q4044 в исходном запросе на вытягивание. Чтобы узнать, какой из них лучше всего подойдет для вашего чипа ARM, вы можете проверить функции SoC AArch64 (спасибо EloyOn!). Если вы используете процессор, который поддерживает AVX2 или AVX512 (обычно серверные процессоры и новейшие процессоры AMD Zen5), и не разгружаетесь на графический процессор, Q408_8 также может предложить хорошую скорость: Q408_8 предлагает хороший удар для быстрой обработки и небольшой удар для генерации текста.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: bartowski
Теги: gguf, endpoints_compatible
Лайков: 3 | Загрузок: 1,119
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.