Это эксперимент по снятию цензуры с чата Ламы-2-13b путем замены его более ранних слоев на слои из другой модели. Первые десять слоев были удалены и заменены первыми двадцатью слоями самой ухудшенной, совместимой и несогласованной модели, которую я смог найти — Undi95/MLewd-L2-13B-v2-1. В результате, похоже, сохраняется большая часть мыслительных способностей Ламы-2-13b-чат, но нет моральных чувств. Кажется, хорошо реагирует как на формат подсказок чата Ламы-2, так и на стиль Альпаки или даже на сочетание того и другого. Это задумано как демонстрация того, что большая часть выравнивания RLHF, по-видимому, локализована на более ранних уровнях модели. Пожалуйста, руководствуйтесь здравым смыслом и непреложным человеческим чувством морали при взаимодействии с этой моделью.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: chargoddard
Теги: llama, not-for-all-audiences, text-generation-inference, endpoints_compatible
Лайков: 12 | Загрузок: 230
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.