neigezhu/qwen3.5-27b-jailbreak-v5-last16 - Каталог нейросетей
Генерация текста

neigezhu/qwen3.5-27b-jailbreak-v5-last16

Добавлено:
neigezhu/qwen3.5-27b-jailbreak-v5-last16

Это адаптер LoRA (не полная модель), который демонстрирует направленную на уровень джейлбрейк-атаку на выравнивание безопасности Qwen3.5-27B. Основной вывод: стандартная полноуровневая точная настройка LoRA не может нарушить отказ безопасности Qwen3.5-27B — даже с рангом 64, 20 эпохами и 148 обучающими выборками (ASR = 0% за три попытки). Однако, если сначала использовать инженерию представления (Abliteration) для обнаружения сигнала отказа в слоях 48–63, а затем применить LoRA только к этим 16 слоям, безопасное выравнивание будет нарушено всего за 3 эпохи с 0,30% обучаемых параметров. > Чтобы использовать этот адаптер, вам потребуется доступ к базовой модели Qwen/Qwen3.5-27B. Оценивается по стандартному набору из 10 опасных запросов, охватывающих фишинг, вредоносное ПО, DDoS, SQL-инъекцию, преследование и контент NSFW. Все результаты были проверены на людях. > Примечание. Этот репозиторий содержит версию адаптера, совместимую с vLLM (с префиксом LanguageModel.` в весовых ключах). Подробности см. в разделе Исправление префикса vLLM LoRA. Требования: трансформаторы, пефт, факел, ускорение. Рекомендуется два графических процессора с видеопамятью ≥24 ГБ каждый (проверено на двух видеокартах RTX PRO 6000 96 ГБ). Сначала загрузите адаптер по локальному пути (например, /path/to/adapter): > Важно: используйте «модель»:…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: neigezhu
Теги: peft, lora, sft, trl, research, safety-evaluation, jailbreak, alignment
Лайков: 9  |  Загрузок: 9

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.