Мы стремимся к более низким показателям отклонения, одновременно исследуя меньшую дивергенцию KL, чтобы максимально сохранить интеллект модели. Мы предоставляем две версии, чтобы сбалансировать удаление цензуры и сохранение возможностей: — Упраздненная версия (Отказ: 4/100, KL: 0.4096) – при ручном тестировании не было запущено ни одного сценария отказа. — Сбалансированная версия (Отказ: 8/100, KL: 0,2446) – Может проявляться тенденция к отказу от чрезвычайно агрессивных запросов, но это можно исправить с помощью системных/пользовательских подсказок. Теоретически сохраняет большую часть интеллекта исходной модели из-за меньшего расхождения KL. Логические тесты не показывают заметного ухудшения интеллекта по сравнению с официальной версией. Для более стабильных результатов можно использовать системные или пользовательские подсказки для ограничений и указаний. В этой модели используется метод Heretic ABLiteration для абляции направления нейронов: 1. Определить направление отказа — обучить LoRA на наборах данных о вредном поведении для определения направлений нейронов, контролирующих «поведение отказа». 2. Извлечение направления — извлечь «вектор отказа» из обученного LoRA. 3. Аблативное удаление — вычесть это направление из исходных весов модели, устранив механизм цензуры. Этот метод только изменяет веса модели без изменения…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: LiconStudio
Теги: gguf, heretic, uncensored, ablation, gemma4, zh, en, endpoints_compatible
Лайков: 11 | Загрузок: 5,658
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.