bartowski/Meta-Llama-3-8B-Instruct-GGUF-special-tokens - Каталог нейросетей
Генерация текста

bartowski/Meta-Llama-3-8B-Instruct-GGUF-special-tokens

Добавлено:
bartowski/Meta-Llama-3-8B-Instruct-GGUF-special-tokens

Конечный токен установлен на неспециальный, загруженный здесь: https://huggingface.co/bartowski/Meta-Llama-3-8B-Instruct-GGUF. Использование вилки llama.cpp из pcuenca llama3-conversion для квантования. Исходная модель: https://huggingface.co/meta-llama/Meta-Llama-3-8B-Instruct Все количественные расчеты сделаны с использованием опции imatrix с набором данных, предоставленным Kalomaze здесь. Отличная статья с диаграммами, показывающими различные характеристики, предоставлена ​​Artefact2 здесь. Первое, что нужно выяснить, это насколько большую модель вы можете запустить. Для этого вам нужно выяснить, сколько у вас оперативной и/или видеопамяти. Если вы хотите, чтобы ваша модель работала как можно БЫСТРО, вам нужно поместить все это в видеопамять вашего графического процессора. Стремитесь к квантованию с размером файла на 1–2 ГБ меньше, чем общий объем видеопамяти вашего графического процессора. Если вам нужно абсолютно максимальное качество, сложите вместе оперативную память вашей системы и видеопамять вашего графического процессора, а затем аналогичным образом возьмите квант с размером файла на 1–2 ГБ меньше, чем эта общая сумма. Далее вам нужно будет решить, хотите ли вы использовать «I-квант» или «K-квант». Если не хотите слишком много думать, возьмите один из К-квантов. Они имеют формат QXKX, например Q5KM. Если вы хотите больше узнать о сорняках, вы можете ознакомиться с этой чрезвычайно полезной таблицей функций: Но, по сути, если…

Модальности:
Генерация текста

Области применения:
Диалог / чат Следование инструкциям


Задача: Генерация текста
Автор: bartowski
Теги: gguf, facebook, meta, llama, llama-3, en, endpoints_compatible, conversational
Лайков: 13  |  Загрузок: 446

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.