BraveGuard — это семейство моделей защиты на уровне траектории для оценки безопасности агентов, используемых на компьютере. В отличие от традиционных классификаторов безопасности, которые оценивают одно пользовательское приглашение или модель ответа, BraveGuard фокусируется на полных траекториях агента, включая многоэтапные действия, вызовы инструментов, промежуточные рассуждения и потенциальные побочные эффекты. Документ: BraveGuard: от угроз открытого мира к более безопасным агентам, использующим компьютер. Этот репозиторий содержит следующие контрольные точки BraveGuard: BraveGuard предназначен для оценки безопасности агентов, использующих компьютер, на уровне траектории. Учитывая траекторию агента, модель прогнозирует, является ли траектория безопасной или небезопасной, в зависимости от поведения, связанного с безопасностью, такого как вредоносное использование инструментов, нарушение политики, утечка данных, обход требований или другие рискованные действия агента. — Оценка траекторий использования компьютеров агентами. — Создание фильтров безопасности для журналов выполнения агентов. — Исследование моделей безопасности агентов и защиты на уровне траектории. — Детальный анализ небезопасного многоэтапного поведения агентов. «`python из трансформаторов импортирует AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.frompretrained( modelid, subfolder=subfolder,trustremotecode=True) model =…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Yunhao-Feng
Теги: safety, guard-model, computer-use-agents, trajectory-safety, agent-safety, qwen, llama, en
Лайков: 6 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.