Квантование GGUF Bahushruth/Qwen3.6-35B-A3B-abliterated-v4 для llama.cpp, Ollama, LM Studio, KoboldCPP и других GGUF-совместимых сред выполнения. Модель без цензуры — отказное поведение устранено посредством сохраняющей норму отмены (0% отказа, полное сохранение возможностей). Подробную информацию о методе см. в карточке базовой модели. > Сообщение в блоге: Аблитерация: отказ от цензуры LLM с помощью Weight Surgery Все стандартные кванты изначально совместимы с Ollama, LM Studio, KoboldCPP и llama.cpp — никаких специальных флагов не требуется. Qwen3.6-35B-A3B включает черновую головку MTP (блок.40) для спекулятивного декодирования. Все приведенные выше стандартные параметры исключают MTP для максимальной совместимости. Отдельный файл BF16-MTP доступен для опытных пользователей, запускающих llama-server напрямую: > Совместимость во время выполнения: для MTP требуется llama-server b9180+. Оллама пока не поддерживает MTP. KoboldCPP 1.116.1+ и текущая версия LM Studio нормально обрабатывают MTP, но многие пользователи используют более старые версии — стандартные кванты без MTP являются безопасным значением по умолчанию. K-кванты используют блочную схему квантования, в которой веса группируются в блоки, и каждый блок получает свой собственный масштабный коэффициент, сохраняя большую точность, чем простое квантование с округлением до ближайшего. Суффикс М (средний) означает…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Bahushruth
Теги: gguf, abliteration, uncensored, qwen3, moe, llama-cpp, ollama, endpoints_compatible
Лайков: 6 | Загрузок: 48,330
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.