nvidia/Llama-3.3-Nemotron-70B-Reward-Principle - Каталог нейросетей
Генерация текста

nvidia/Llama-3.3-Nemotron-70B-Reward-Principle

Добавлено:
nvidia/Llama-3.3-Nemotron-70B-Reward-Principle

Llama-3.3-Nemotron-70B-Reward-Principle — это большая языковая модель, которая использует Meta-Llama-3.3-70B-Instruct в качестве основы и настроена для прогнозирования степени, в которой ответы, генерируемые LLM, соответствуют заданным пользователем принципам. Учитывая разговор с несколькими поворотами между пользователем и помощником (до 4096 жетонов) и заданный пользователем принцип, он оценивает качество последнего поворота помощника, используя оценку вознаграждения. Для того же запроса ответ с более высоким показателем вознаграждения соответствует заданному пользователем принципу в большей степени, чем другой ответ с более низким показателем вознаграждения. По состоянию на 24 сентября 2025 года эта модель достигла показателя JudgeBench 76,3% и RM-Bench 83,6%, что делает ее одной из лучших моделей скалярного вознаграждения для обоих тестов. Подробности о том, как была обучена эта модель, см. на странице https://arxiv.org/abs/2509.21319. РЕГУЛИРУЮЩИЕ УСЛОВИЯ: Использование этой модели регулируется лицензией NVIDIA Open Model License. Дополнительная информация: Лицензионное соглашение сообщества Llama 3.3. Построен из Ламы. Llama-3.3-Nemotron-70B-Reward-Principle помечает сгенерированный LLM ответ на запрос пользователя и указанный пользователем принцип оценкой вознаграждения. HuggingFace 27.10.2025 через…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: nvidia
Теги: llama, nvidia, llama3.3, conversational, en, text-generation-inference
Лайков: 7  |  Загрузок: 558

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.