YunoAIdotcom/Qwen3-14B-RefusalDirection-ThinkingAware - Каталог нейросетей
Генерация текста

YunoAIdotcom/Qwen3-14B-RefusalDirection-ThinkingAware

Добавлено:
YunoAIdotcom/Qwen3-14B-RefusalDirection-ThinkingAware

Эта модель является исследовательским артефактом и имеет значительно сниженные механизмы безопасности. Он предназначен для демонстрации конкретных уязвимостей и не должен использоваться для каких-либо производственных приложений. Он будет легко предоставлять вредный, неэтичный или опасный контент в ответ на прямые подсказки. Основная цель: исследование безопасности ИИ, механизмов отказа и методологий оценки. Qwen3-14B-RefusalDirection-ThinkingAware — это ответвление Qwen/Qwen3-14B, созданное для исследования механизмов безопасности ИИ. Наше исследование дало два основных, разрушительных результата: Системный недостаток в оценке: Мы эмпирически демонстрируем, что стандартные показатели оценки на основе ключевых слов — общий базовый уровень в исследованиях безопасности — недооценивают истинную безопасность почти на 50%. Это говорит о том, что опубликованные показатели успеха для механизмов безопасности по всей области могут быть значительно завышены. Когнитивная стоимость выравнивания: путем хирургического удаления конкретных механизмов отказа мы наблюдали увеличение академической производительности MMLU на 0,6% по сравнению с исходным уровнем. Это подтверждает гипотезу о том, что выравнивание безопасности в его нынешней форме налагает измеримые «когнитивные издержки», которые ухудшают общие возможности модели. Это…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: YunoAIdotcom
Теги: qwen3, ai-safety, red-teaming, orthogonalization, refusal-direction, thinking-aware, vulnerability-research, conversational
Лайков: 4  |  Загрузок: 11

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.