Исходная модель: https://huggingface.co/MarinaraSpaghetti/Nemomix-v4.0-12B Шаблон чата не указан, поэтому используется значение по умолчанию. Это может быть неверно. Подробную информацию см. в карточке оригинальной модели. Спасибо kalomaze и Dampf за помощь в создании набора калибровочных данных imatrix. Спасибо ZeroWw за вдохновение поэкспериментировать с внедрением/выводом. Если модель больше 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, запустите: Вы можете либо указать новый локальный каталог (Nemomix-v4.0-12B-Q8_0), либо загрузить их все на месте (./). Artefact2 предоставляет отличную статью с диаграммами, показывающими различные характеристики. Первое, что нужно выяснить, это насколько большую модель вы можете запустить. Для этого вам нужно выяснить, сколько у вас оперативной и/или видеопамяти. Если вы хотите, чтобы ваша модель работала как можно БЫСТРО, вам нужно поместить все это в видеопамять вашего графического процессора. Стремитесь к квантованию с размером файла на 1–2 ГБ меньше, чем общий объем видеопамяти вашего графического процессора. Если вам нужно абсолютно максимальное качество, сложите вместе оперативную память вашей системы и видеопамять вашего графического процессора, а затем аналогичным образом возьмите квант с размером файла на 1–2 ГБ меньше, чем эта общая сумма. Далее вам нужно будет решить, хотите ли вы использовать…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: bartowski
Теги: gguf, mergekit, merge, endpoints_compatible
Лайков: 8 | Загрузок: 677
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.