Qwen3-Nemotron-235B-A22B-GenRM — это генеративная модель вознаграждения (GenRM), которая использует Qwen3-235B-A22B-Thinking-2507 в качестве основы и точно настроена для оценки качества ответов помощника. Учитывая историю разговоров, новый запрос пользователя и два ответа кандидата в помощники, он вычисляет индивидуальную оценку полезности для каждого ответа и рейтинговую оценку. Этот GenRM используется в обучении с подкреплением на основе обратной связи с человеком NVIDIA-Nemotron-3-Nano-30B-A3B-BF16. Подробности обучения см. в техническом отчете Nemotron 3 Nano. HuggingFace 15 декабря 2025 г., https://huggingface.co/nvidia/Qwen3-Nemotron-235B-A22B-GenRM Мы разработали эту модель, взяв за основу Qwen/Qwen3-235B-A22B-Thinking-2507. Эта модель содержит 235 миллиардов параметров. Тип(ы) ввода: Текст Формат ввода: Строка Параметры ввода: Одномерный (1D) Другие свойства, связанные с вводом: Максимум 128 тыс. токенов Тип(ы) вывода: Формат вывода текста: Строка Параметры вывода: Одномерный (1D) Наши модели ИИ разработаны и/или оптимизированы для работы в системах с графическим ускорением NVIDIA. За счет использования аппаратного обеспечения NVIDIA (например, ядер графического процессора) и программных инфраструктур (например, библиотек CUDA) модель достигает более быстрого…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: nvidia
Теги: qwen3_moe, nvidia, qwen3, conversational, en
Лайков: 29 | Загрузок: 15,258
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.