Оригинальная модель: https://huggingface.co/maldv/badger-lambda-llama-3-8b Если размер модели превышает 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, выполните команду: Вы можете указать новый local-dir (badger-lambda-llama-3-8b-Q8_0) или загрузить их все на месте (./) Здесь Artefact2 предоставляет отличное описание с диаграммами, показывающими различные показатели. Первое, что нужно выяснить, — насколько велика модель, которую вы можете запустить. Для этого вам нужно будет выяснить, сколько у вас ОЗУ и/или VRAM. Если вы хотите, чтобы ваша модель работала как можно БЫСТРЕЕ, вам нужно поместить все это на VRAM вашего графического процессора. Стремитесь к кванту с размером файла на 1-2 ГБ меньше, чем общая VRAM вашего графического процессора. Если вы хотите получить абсолютный максимум качества, добавьте как системную оперативную память, так и VRAM вашего графического процессора вместе, а затем аналогичным образом захватите квант с размером файла на 1-2 ГБ меньше, чем это общее количество. Next, you’ll need to decide if you want to use an ‘I-quant’ or a ‘K-quant’. If you don’t want to think too much, grab one of the K-quants. These are in format ‘QXKX’, like Q5KM. If you want to get more into the weeds, you can check out this extremely useful feature chart: But basically, if you’re aiming for…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: bartowski
Теги: gguf, llama3, endpoints_compatible, conversational
Лайков: 3 | Загрузок: 979
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.