> [!IMPORTANT] > Совместимость: для этих файлов GGUF требуется сборка llama.cpp с поддержкой архитектуры K2 Horizon. До тех пор, пока опора не приземлится вверх по течению, используйте вилку MBZUAI-IFM. Квантования GGUF IFM/K2-Horizon-7B, модель только для плотного декодера 7B для рассуждений, кодирования, работы с длинным контекстом и использования инструментов. Исходная контрольная точка поддерживает собственный контекст длиной 524 288 маркеров (512K). Результаты сравнения, представленные IFM для исходной контрольной точки K2-Horizon-7B. Файлы являются текстовыми GGUF; проектор не требуется. Селективный вариант использует базовую линию Q4KM с тензорами проекции внимания Q/K/V/O, поддерживаемыми на Q6K; это ручная тензорно-селективная сборка и не использует матрицу важности. Контрольные суммы SHA-256 представлены в SHA256SUMS.txt`. Каждый GGUF встраивает шаблон чата, совместимый с llama.cpp. chattemplate.jinja — это соответствующая внешняя копия для инструментов, которым она требуется. Исходный шаблон сохраняется как chattemplate.upstream.jinja для сред выполнения с полной поддержкой Jinja. xml — это формат вызова инструментов по умолчанию. Используйте —chat-template-kwargs, чтобы выбрать json или xmltyped` при необходимости. Используйте вилку IFM K2 Horizon llama.cpp. В приведенном ниже примере используется практический контекст 128K; -c 524288 может быть…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: abenzerps
Теги: gguf, llama.cpp, k2-horizon, long-context, 512k-context, dense, conversational, en
Лайков: 4 | Загрузок: 2,749
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.