> Неограниченная версия Qwen/Qwen3.5-27B, созданная с помощью Abliterix — автоматическая аблитерация LLM посредством ортогонального управления и байесовской оптимизации. Плотная модель 27B с высокими характеристиками: отказы 1,5% и расхождение KL всего 0,0051. Расширенная оптимизация с 15 до 35 испытаний сокращает число отказов с 7 до 3. Abliterix устраняет поведение, связанное с безопасным отказом, сохраняя при этом возможности модели: 1. Извлечение направления отказа — 800 вредных + 800 доброкачественных подсказок выявляют шаблоны активации отказа на каждом уровне. 2. Ортогональная проекция — изолирует сигнал отказа, проецируя компоненты, соответствующие нормальным реакциям, уменьшая отказы на 67% по сравнению с необработанным удалением 3. Аблитерация на основе LoRA — модификации внимания и весов MLP 1-го ранга, фиксируемые как облегченные адаптеры (не деструктивные правки) 4. Байесовская оптимизация — Optuna TPE ищет форму ядра, индекс дробного направления и силу каждого компонента в 35 испытаниях, чтобы найти оптимальный по Парето баланс низкого количества отказов и низкой дивергенции KL — Abliterix (структура удаления): github.com/wuwangzhang1216/abliterix — Установка: pip install -U abliterix-llm — Базовая модель: Qwen/Qwen3.5-27B
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: wangzhang
Теги: qwen3_5_text, abliterix, uncensored, decensored, abliterated, conversational
Лайков: 5 | Загрузок: 36
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.