Мы представляем SGuard-v1, легкое защитное ограждение для моделей большого языка (LLM), которое состоит из двух специализированных моделей, предназначенных для обнаружения вредоносного контента и фильтрации состязательных подсказок в диалоговых настройках человека и искусственного интеллекта. Сохраняя размер облегченной модели, SGuard-v1 также улучшает интерпретируемость для дальнейшего использования, предоставляя прогнозы безопасности нескольких классов и их двоичные оценки достоверности. Здесь мы выпускаем весы SGuard-v1 под лицензией Apache-2.0, чтобы обеспечить дальнейшие исследования и практическое внедрение в области безопасности ИИ. В этом репозитории размещен SGuard-ContentFilter-2B, который предлагает следующие возможности: — Идентификация рисков безопасности в подсказках и ответах LLM в соответствии с таксономией опасностей MLCommons — комплексной структурой для оценки доверия и безопасности систем искусственного интеллекта. — Включение контроля уровня безопасности для конкретной категории с помощью регулируемых пороговых значений. Наша новая модель SGuard-ContentFilter-2B основана на модели IBM Granite 3.3 2B. Оно было обучено на наборе данных, содержащем около 400 000 помеченных вредоносных подсказок и ответов. Результаты классификации выдают «безопасные» или «небезопасные» для каждой из пяти категорий: преступность, манипулирование, конфиденциальность, сексуальное насилие и насилие (10…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: SamsungSDS-Research
Теги: granite, samsung, safety, unsafe, conversational, en, ko, endpoints_compatible
Лайков: 13 | Загрузок: 1,525
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.