> [!ВНИМАНИЕ] > Внимание! > Эта модель еще не поддерживается должным образом в llama.cpp и не будет работать. > См. обсуждение здесь: https://github.com/ggerganov/llama.cpp/pull/8031#issuecomment-2213635819 Исходная модель: THUDM/glm-4-9b-chat-1m Исходный тип dtype: BF16 (bfloat16) Квантизация: https://github.com/ggerganov/llama.cpp/pull/6999 IMatrix набор данных: здесь — Файлы — Общие кванты — Все кванты — Загрузка с помощью Huggingface-cli — Вывод — Простой шаблон чата — Шаблон чата с системной подсказкой — Llama.cpp — Часто задаваемые вопросы — Почему IMatrix не применяется везде? — Как мне объединить разделенный GGUF? —— | ———- | ——— | —— | ———— | ——— | Если файл модели большой, он разделен на несколько файлов. Чтобы загрузить их все в локальную папку, запустите: Согласно этому исследованию, оказывается, что низкие квантования — единственные, которые получают выгоду от входных данных imatrix (согласно результатам hellaswag). 1. Убедитесь, что у вас есть gguf-split. Чтобы получить gguf-split, перейдите по адресу https://github.com/ggerganov/llama.cpp/releases. — Загрузите соответствующий zip-архив для вашей системы из последней версии. — Разархивируйте архив, и вы сможете найти gguf-split 2.…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: legraphista
Теги: gguf, glm, chatglm, thudm, quantized, GGUF, quantization, static
Лайков: 18 | Загрузок: 4,364
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.