bartowski/dolphin-2.9-llama3-8b-1m-GGUF - Каталог нейросетей
Генерация текста

bartowski/dolphin-2.9-llama3-8b-1m-GGUF

Добавлено:
bartowski/dolphin-2.9-llama3-8b-1m-GGUF

Оригинальная модель: https://huggingface.co/cognitivecomputations/dolphin-2.9-llama3-8b-1m Все кванты сделаны с использованием опции imatrix с набором данных, предоставленным Kalomaze здесь Если модель больше 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, выполните команду: Вы можете указать новый local-dir (dolphin-2.9-llama3-8b-1m-Q8_0) или загрузить их все на месте (./) Здесь Artefact2 предоставляет отличное описание с диаграммами, показывающими различные показатели. Первое, что нужно выяснить, — насколько велика модель, которую вы можете запустить. Для этого вам нужно будет выяснить, сколько у вас ОЗУ и/или VRAM. Если вы хотите, чтобы ваша модель работала как можно БЫСТРЕЕ, вам нужно поместить все это на VRAM вашего графического процессора. Стремитесь к кванту с размером файла на 1-2 ГБ меньше, чем общая VRAM вашего графического процессора. Если вы хотите получить абсолютный максимум качества, добавьте как системную оперативную память, так и VRAM вашего графического процессора вместе, а затем аналогичным образом захватите квант с размером файла на 1-2 ГБ меньше, чем это общее количество. Далее вам нужно будет решить, хотите ли вы использовать «I-квант» или «K-квант». Если вы не хотите слишком много думать, возьмите одного из К-квантов. Они имеют формат «QXKX», как и Q5KM. Если вы хотите больше узнать о сорняках,…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: bartowski
Теги: gguf, generated_from_trainer, axolotl, endpoints_compatible, imatrix, conversational
Лайков: 3  |  Загрузок: 1,092

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.