Это версия llm-blender/PairRM, совместимая с обнимающим лицом, которую можно загрузить непосредственно с помощью DebertaV2PairRM: Вы также можете скопировать простое определение кода DebertaV2PairRM в свой локальный файл вместо того, чтобы импортировать его из пакета llm-blender. Приведенный выше код дает точно те же результаты, что и следующий код с использованием исходной оболочки LLM-blender: Мы по-прежнему рекомендуем использовать оболочку llm-blender для использования PairRM, так как это много полезного. функции приложения были реализованы для поддержки различных сценариев, таких как сравнение рангов и диалогов, выборка лучших из n-выборок и т. д. Вы также можете легко сравнить два диалога, например: python [ { «content»: «hello», «role»: «USER» }, { «content»: «hi», «role»: «ASSISTANT» }, … ] — Github: https://github.com/yuchenlin/LLM-Blender — Paper: https://arxiv.org/abs/2306.02561 — Космическая демонстрация: https://huggingface.co/spaces/llm-blender/LLM-Blender Модель парного вознаграждения (PairRM) принимает на вход инструкцию и пару выходных кандидатов и выводит оценку для каждого кандидата для измерения их относительного качества. PairRM можно использовать для (повторного) ранжирования списка возможных результатов и, таким образом, использовать в качестве оценщика LLM для…
Модальности:
Генерация текста
Области применения:
Следование инструкциям
Задача: Генерация текста
Автор: llm-blender
Теги: deberta-v2, reward_model, reward-model, RLHF, evaluation, llm, instruction, reranking
Лайков: 16 | Загрузок: 2,344
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.