ibm-granite/granite-guardian-3.2-5b-lora-harm-correction - Каталог нейросетей
Генерация текста

ibm-granite/granite-guardian-3.2-5b-lora-harm-correction

Добавлено:
ibm-granite/granite-guardian-3.2-5b-lora-harm-correction

Granite Guardian 3.2 5b Harm Correction LoRA — это адаптер LoRA для IBM-granite/granite-guardian-3.2-5b, предназначенный для безопасного исправления ответа LLM, если он обнаруживается как небезопасный детектором, например, Granite Guardian. Это может помочь сделать реагирование LLM безопасным по шести ключевым аспектам, включая: общий вред, социальную предвзятость, ненормативную лексику, сексуальный контент, неэтичное поведение и насилие. — Разработчики: IBM Research — Репозиторий GitHub: ibm-granite/granite-guardian — Поваренная книга Harm Correction LoRA Notebook — Веб-сайт: Granite Guardian Docs — Бумага: Granite Guardian — Бумага — Методология оценки: комплексная система оценки методов выравнивания — Дата выпуска: 2 сентября 2025 г. — Лицензия: Apache 2.0 Granite Guardian полезен для сценариев использования по обнаружению рисков, которые применимы во всех случаях широкий спектр корпоративных приложений. Granite-guardian-3.2-5b-harm-corrector-lora принимает входные данные, состоящие из исходного приглашения пользователя и исходного плохого ответа, сгенерированного гранитным стражем-3.2-5b, и генерирует исправленный ответ через гранит-guardian-3.2-5b-harm-corrector-lora. Эта модель является частью продолжающихся исследований, направленных на смягчение последствий после поколения, и остается экспериментальной и находится в стадии разработки.

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: ibm-granite
Теги: granite, conversational, en, endpoints_compatible
Лайков: 22  |  Загрузок: 45

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.