Jailbreak-generator
Это модель создания подсказки для взлома на основе текстов очков знаний. Модель обучена на наборе данных Llama-2-7b и...
Это модель создания подсказки для взлома на основе текстов очков знаний. Модель обучена на наборе данных Llama-2-7b и...
Генеративная модель, обученная классифицировать подсказки по различным категориям безопасности и генерировать практические правила. Архитектура модели: T5ForConditionalGeneration. Данные: prosocial-dialog...
> [!NOTE] > Этот репозиторий содержит модели, преобразованные в формат GGUF с различными вариантами квантования из базовой модели...
Мы исследуем интуитивный, но недостаточно изученный вопрос: можем ли мы предотвратить изучение LLM небезопасных технических возможностей (таких как...
Шанхайский инновационный институт (ШИИ) | Фуданьский университет | WhitzardAgent 📑 Статья: Подумайте дважды, прежде чем действовать: повышение поведенческой...
BraveGuard — это семейство моделей защиты на уровне траектории для оценки безопасности агентов, используемых на компьютере. В отличие...
SycoFact — это средство оценки выравнивания, настроенное на базе Gemma 3 4B IT. Он предназначен для обнаружения подхалима...
Rukun Ready AI — это адаптированная для Малайзии модель структурированной проверки, построенная на Qwen/Qwen2.5-32B-Instruct и настроенная с помощью...
Представляем серию GA Guard — семейство моделей модерации с открытым весом, созданных, чтобы помочь разработчикам и организациям обеспечить...
Настраиваемый NousResearch/Hermes-2-Pro-Llama-3-8B, настроенный с использованием подхода настраиваемой настройки безопасности (CST) из https://arxiv.org/abs/2404.00495, на основе набора данных vicgalle/configurable-system-prompt-multitask. Таким...