R3-Qwen3-14B-4k является частью семейства R3, серии надежных моделей вознаграждения, не зависящих от рубрик. Мы выполняем SFT на семействе моделей Qwen3 в масштабах 4B, 8B и 14B, а также на рассуждениях Фи-4 плюс. Ознакомьтесь с нашей статьей для получения дополнительной информации! — Тип модели: модель вознаграждения, обученная на тщательно подобранном наборе данных R3, собранном из 45 различных источников и охватывающем такие задачи, как классификация, оптимизация предпочтений и ответы на вопросы. Каждый пример в наборе данных содержит описание инструкции и задачи, входные данные, ответы, критерии оценки и балл вместе с соответствующими рассуждениями. — Язык(и) (NLP): английский — Лицензия: Apache 2.0 — Доработано на основе модели: Qwen/Qwen3-14B — Страница проекта: https://rubricreward.github.io — Репозиторий: https://github.com/rubricreward/r3 — Бумага: https://arxiv.org/abs/2505.13388
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: rubricreward
Теги: qwen3, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 9
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.