zai-org/BPO - Каталог нейросетей
Генерация текста

zai-org/BPO

Добавлено:
zai-org/BPO

Оперативная оптимизация «черного ящика»: выравнивание больших языковых моделей без обучения модели — репозиторий: https://github.com/thu-coai/BPO — документ: https://arxiv.org/abs/2311.04155 — данные: https://huggingface.co/datasets/THUDM/BPO BPO — это метод выравнивания «черного ящика», который отличается от методов, основанных на обучении (таких как PPO или DPO). BPO требует только обучения модели plug-and-play и оптимизирует LLM за счет оптимизации ввода данных пользователем. Таким образом, его можно использовать в различных LLM с открытым исходным кодом или на основе API. Модель оптимизации подсказки обучается по подсказке. пары оптимизации, которые содержат функции человеческих предпочтений. Подробную информацию о наборе данных можно найти здесь. Оптимизатор параметров подсказок построен на основе Llama-2-7b-chat-hf. — Охват задач недостаточен, поскольку мы использовали только данные из открытых источников, чтобы получить около 14 тысяч оптимизированных подсказок. Очевидно, что невозможно охватить широкий спектр пользовательских запросов, поэтому текущая модель может не работать хорошо при каждом запросе. — Из-за небольшого соотношения задач с длинным контекстом и математических задач оптимизатор подсказок работает хуже при решении этих задач. Если вы считаете, что наша модель полезна в вашей работе,…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: zai-org
Теги: llama, bpo, thudm, en, text-generation-inference
Лайков: 21  |  Загрузок: 692

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.