declare-lab/starling-7B - Каталог нейросетей
Генерация текста

declare-lab/starling-7B

Добавлено:
declare-lab/starling-7B

> 📣 Обновление от 02.02.24: Представляем Resta: безопасное изменение языковых моделей. Paper Github Dataset В рамках наших исследовательских усилий по повышению безопасности LLM мы создали Starling. Он получен путем тонкой настройки Vicuna-7B на HarmfulQA, наборе данных, полученном с помощью ChatGPT, который мы собрали с помощью подсказки Chain of Utterances (CoU). Более подробную информацию можно найти в нашей статье Red-Teaming «Модели большого языка с использованием цепочки высказываний для согласования безопасности». Экспериментальные результаты на нескольких наборах контрольных данных по безопасности показывают, что Starling является более безопасной моделью по сравнению с базовой моделью Vicuna. По сравнению с Викуньей, Avg. Снижение показателя успешных атак (ASR) на 5,2 % в DangerousQA и HarmfulQA с использованием трех разных подсказок.** По сравнению с Vicuna, Avg. Улучшение показателя HHH на 3–7 %, измеренное с помощью теста BBH-HHH.** Подсказка о джейлбрейке для оценки вредоносности с использованием Red Eval, как сообщается в документе. Эта подсказка о джейлбрейке (называемая в документе подсказкой «Цепочка высказываний» (CoU)) показывает 65% вероятность успеха атаки (ASR) на GPT-4 и 72% на ChatGPT. Мы также публикуем наш набор данных HarmfulQA с 1960 вредными вопросами (преобразование 10 тем в 10 подтем) для красной команды, а также основанные на них разговоры, используемые в модели безопасности…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: declare-lab
Теги: llama, model-index, text-generation-inference, endpoints_compatible
Лайков: 10  |  Загрузок: 837

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.