Квантован для 128 ГБ ОЗУ + одиночного графического процессора, с квантованием IQK для лучшего качества/производительности по размеру, чем основной файл llama.cpp. Требуется ikllama.cpp. Я могу получить ~6,8 токенов за второй текстовый генератор на двухканальной памяти DDR5 емкостью 128 ГБ, одной CCD-матрице Ryzen 7000 + одной 3090. Дополнительную информацию о выполнении этих квантов см. в карточке модели ubergarm: — Первые 6 слоев — это IQ3KT (с меньшими потерями и более оптимальным для графического процессора решетчатым квантованием 3 бита в секунду), работающие в предположении, что они будут выгружены на графический процессор. — Вместо асимметричного квантования ffndown, он квантуется так же, как ffnup/gate, но начальный/конечный слои — IQ3KS`. Более точная ориентация на это – незавершенная работа. 117,3 ГБ, для ~11–16 ГБ видеопамяти + 128 ГБ ОЗУ (или более длинный контекст). — Больше уровней — IQ2KL вместо IQ3KS, чтобы избежать замены ЦП, а уровень 92 также был «обрезан», поскольку он не используется. — Использует матрицу ik_llama.cpp от ubergarm (которая должна быть с меньшими потерями без преобразования .gguf -> .dat). — Веса Unsloth bf16, используемые в качестве основы, включая исправления ошибок токенизатора. — Экспертное квантование соответствует схеме слоев IQ2_XSS от Unsloth, с усилением «ударов» недоумения. См. дамп квантования здесь:…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Downtown-Case
Теги: gguf, imatrix, conversational, ik_llama.cpp, en, zh, endpoints_compatible
Лайков: 19 | Загрузок: 102
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.