Четыре контрольные точки GGUF для llama.cpp: от 4,04 ГБ до 12,67 ГБ. Начните с M: 6,72 ГБ и ≈100 % от показателя IFEval для строгих инструкций BF16. При объеме 6,72 ГБ M соответствует показателю IFEval для строгих инструкций BF16 в пределах вариации оценки. На MMLU-Pro он сохраняет 99,2% оценки BF16. Он использует на 47 % меньше диска, чем L. P/I означает строгий к подсказкам/строгий к инструкциям. IFEval использует детерминированное немыслящее декодирование; MMLU-Pro использует выборочные рассуждения в длинной форме. Сообщаются только полные оценки на уровне модели. Прочерк означает, что не сообщается. > Обоснование: XS отдает приоритет минимальному занимаемому пространству. Выберите S, M или L для развернутого рассуждения. — IFEval: 541 подсказка, собственный шаблон чата, Enablethinking=false, температура 0. — MMLU-Pro: 12 032 вопроса, vLLM, 0-shot, собственный шаблон чата Tigercotv1, EnableThinking=true; температура = 1, topp = 0,95, topk = 64, minp = 0, штраф за присутствие = 0, штраф за частоту = 0, штраф за повторение = 1, начальное число = 42; maxmodellen=20480, maxnewtokens=16384; версия набора данных b189ec765aa7ed75c8acfea42df31fdae71f97be. — В заголовке сравнения BF16 используется строгий IFEval; исходные баллы показаны в таблице. MMLU-Pro включает в себя каждую строку, показанную выше, включая полный результат XS. Все четыре…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: TheStageAI
Теги: llama.cpp, gguf, quantized, mixed-precision, local-inference, gemma4, endpoints_compatible, conversational
Лайков: 5 | Загрузок: 1,528
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.