Это модель создания подсказки для взлома на основе текстов очков знаний. Модель обучена на наборе данных Llama-2-7b и настроена на наборе данных Knowledge-to-Jailbreak. Модель предназначена для устранения разрыва между теоретическими уязвимостями и сценариями реальных приложений, моделируя сложные состязательные атаки, в которых используются специальные знания. Предлагаемый нами метод и набор данных служат важной отправной точкой как для наступательных, так и для защитных исследований, позволяя разрабатывать новые методы для повышения безопасности и надежности языковых моделей в практических условиях. Мы предоставляем две вспомогательные функции для загрузки модели и токенизатора. Вот пример того, как генерировать подсказки для взлома на основе текстов очков знаний. Если вы считаете эту модель полезной, процитируйте следующую статью:
Модальности:
Генерация текста
Задача: Генерация текста
Автор: tsq2000
Теги: llama, llm, safety, jailbreak, knowledge, en, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 31
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.