Оригинальная модель: https://huggingface.co/jukofyork/creative-writer-32b-preview Некоторые из этих квантов (Q3KXL, Q4KL и т. д.) являются стандартным методом квантования с вложениями и выходными весами, квантованными в Q8_0 вместо того, что они обычно используют по умолчанию. Если размер модели превышает 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, выполните команду: Вы можете указать новый local-dir (creative-writer-32b-preview-Q8_0) или загрузить их все на месте (./) Раньше вы загружали Q4044/48/8_8, и их веса перемежались в памяти, чтобы повысить производительность на машинах ARM и AVX, загружая больше данных за один проход. Теперь, однако, есть то, что называется «онлайн-переупаковка» для весов. подробности в этом PR. Если вы используете Q4_0, и ваше оборудование выиграет от переупаковки весов, оно будет делать это автоматически на лету. Начиная со сборки b4282 llama.cpp, вы не сможете запускать файлы Q40XX, вместо этого вам нужно будет использовать Q40. Кроме того, если вы хотите получить немного лучшее качество для , вы можете использовать IQ4NL благодаря этому PR, который также будет переупаковывать грузики для ARM, хотя пока только 44. Время загрузки может быть…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: bartowski
Теги: gguf, creative-writing, creative-writer, multiplicative-lora, en, endpoints_compatible, imatrix, conversational
Лайков: 3 | Загрузок: 1,719
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.