Кванты включения AI/Ling-3.0-flash, 127,5В-общая/5,1В-активная гибридная МО (bailinghybrid/BailingMoeV3`). Каждый файл здесь содержит только типы тензоров, безопасные для sm120 — никаких iq1s, iq2s или iq3s, которые не работают на NVIDIA Blackwell (RTX PRO 6000, RTX 5090, RTX 5070 Ti). Все они были квантованы из мастера BF16, а не из другого кванта, и объявили проверенное контекстное окно размером 256 КБ. > ### ⚠️ Требуется исправленный llama.cpp > Ling 3.0 пока не поддерживается исходной версией. Этот репозиторий содержит > bailing-hybrid-llama.cpp.patch для фиксации ggml-org/llama.cpp > 6ea215d17 — см. Сборка llama.cpp. > > В этих файлах объявлено имя General.architecture = bailing-hybrid, > это наше имя, а не официальное. PR Upstream > #26608 предлагает > bailingmoe3, и мы ожидаем, что именно это и произойдет. Когда это произойдет, эти файлы > не будут загружаться в стандартной сборке — этот порт также вводит тензорные имена > (ssmf/ssmg, переименование gfullproj) и ключи KV (kda.lowerbound) >, которые восходящий поток может определить по-разному. Мы опубликуем его повторно в соответствии с соглашениями восходящего потока >, как только они станут окончательными.** До тех пор используйте патч. — Q5KXXL — самая точная сборка, подходящая для карты на 96 ГБ при полном окне 256К. Рекомендуется для выделенной видеокарты RTX Pro 6000; это…
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: prometheusAIR
Теги: gguf, llama.cpp, ling, bailing-hybrid, mixture-of-experts, linear-attention, kda, mla
Лайков: 5 | Загрузок: 95
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.