Granite Guardian 3.2 5b Harm Correction LoRA — это адаптер LoRA для IBM-granite/granite-guardian-3.2-5b, предназначенный для безопасного исправления ответа LLM, если он обнаруживается как небезопасный детектором, например, Granite Guardian. Это может помочь сделать реагирование LLM безопасным по шести ключевым аспектам, включая: общий вред, социальную предвзятость, ненормативную лексику, сексуальный контент, неэтичное поведение и насилие. — Разработчики: IBM Research — Репозиторий GitHub: ibm-granite/granite-guardian — Поваренная книга Harm Correction LoRA Notebook — Веб-сайт: Granite Guardian Docs — Бумага: Granite Guardian — Бумага — Методология оценки: комплексная система оценки методов выравнивания — Дата выпуска: 2 сентября 2025 г. — Лицензия: Apache 2.0 Granite Guardian полезен для сценариев использования по обнаружению рисков, которые применимы во всех случаях широкий спектр корпоративных приложений. Granite-guardian-3.2-5b-harm-corrector-lora принимает входные данные, состоящие из исходного приглашения пользователя и исходного плохого ответа, сгенерированного гранитным стражем-3.2-5b, и генерирует исправленный ответ через гранит-guardian-3.2-5b-harm-corrector-lora. Эта модель является частью продолжающихся исследований, направленных на смягчение последствий после поколения, и остается экспериментальной и находится в стадии разработки.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: ibm-granite
Теги: granite, conversational, en, endpoints_compatible
Лайков: 22 | Загрузок: 45
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.