Оригинальная модель: Qwen/Qwen2-7B-Instruct Оригинальный dtype: BF16 (bfloat16) Quantized by: llama.cpp b3091 IMatrix dataset: here — Files — IMatrix — Common Quants — All Quants — Downloading using huggingface-cli — Inference — Simple chat template — Chat template with system prompt — Llama.cpp — FAQ — Почему IMatrix применяется не везде? — Как объединить сплит GGUF? —— | ———- | ——- | ——- | ———— | ——— | Если файл модели большой, он был разделен на несколько файлов. Чтобы загрузить их все в локальную папку, запустите: Согласно этому исследованию, похоже, что более низкие квантования являются единственными, которые выигрывают от ввода imatrix (согласно результатам hellaswag). 1. Убедитесь, что у вас есть gguf-split — Чтобы получить доступ к gguf-split, перейдите на https://github.com/ggerganov/llama.cpp/releases — Загрузите соответствующий zip-файл для вашей системы из последней версии — Распакуйте архив, и вы сможете найти gguf-split 2. Найдите папку кусков GGUF (например, Qwen2-7B-Instruct.Q80) 3. Запустите gguf-split —merge Qwen2-7B-Instruct.Q80/Qwen2-7B-Instruct.Q80-00001-of-XXXXX.gguf Qwen2-7B-Instruct.Q80.gguf — Обязательно укажите gguf-split на первый…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: legraphista
Теги: gguf, chat, quantized, GGUF, imatrix, quantization, imat, static
Лайков: 3 | Загрузок: 1,627
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.