Исходная модель: https://huggingface.co/Gryphe/Pantheon-Reasoning-26B-A4B-1.1 — llama.cpp — ramalama — LM Studio — koboldcpp — Jan AI — Веб-интерфейс создания текста — LoLLMs Некоторые из этих квантов (Q3KXL, Q4KL и т. д.) представляют собой стандартный метод квантования с встраиванием и выходными весами, квантованными вместо этого до Q8_0. того, что они обычно делают по умолчанию. Если модель больше 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, запустите: Вы можете указать новый локальный каталог (GryphePantheon-Reasoning-26B-A4B-1.1-Q80) или загрузить их все на месте (./). Раньше вы загружали Q4044/48/8_8, и их веса чередовались в памяти, чтобы повысить производительность на машинах ARM и AVX за счет загрузки большего количества данных за один проход. Однако сейчас существует так называемая «онлайн-переупаковка» весов. подробности в этом PR. Если вы используете Q4_0 и ваше оборудование выиграет от переупаковки весов, оно сделает это автоматически на лету. Начиная с сборки llama.cpp b4282, вы не сможете запускать файлы Q40XX, и вместо этого вам придется использовать Q40. Кроме того, если вы хотите получить немного лучшее качество для , вы можете использовать IQ4NL благодаря этому…
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Следование инструкциям Диалог / чат
Задача: Генерация текста
Автор: bartowski
Теги: gguf, gemma4, conversational, instruct, finetune, axolotl, roleplay, reasoning
Лайков: 7 | Загрузок: 11,004
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.