BBQGOD/DeepSeek-GRM-16B - Каталог нейросетей
Генерация текста

BBQGOD/DeepSeek-GRM-16B

Добавлено:
BBQGOD/DeepSeek-GRM-16B

В этой работе мы представляем DeepSeek-GRM, генеративную модель вознаграждения (GRM), основанную на настройке самопринципиальной критики (SPCT). Для любой пары «запрос-ответ» модель сначала пишет свой собственный принцип оценки, затем выдает критику в свободной форме и, наконец, выдает дискретные оценки от 1 до 10, образуя прозрачный конвейер «принцип → критика → оценка», который можно проверять или выбирать несколько раз при выводе для более детальных суждений. Эта генеративная формулировка повышает качество генерации вознаграждений в широком спектре задач RM и может принести пользу таким приложениям, как оценка, автономный сбор данных и онлайн-обучение с подкреплением (RL) на LLM. SPCT содержит двухэтапный рецепт, который сочетает в себе отбраковывающую тонкую настройку с онлайновым RL на основе правил. Обширные эксперименты показывают, что модель обеспечивает значительное улучшение производительности RM по сравнению с существующими подходами RM по таким критериям, как RewardBench, PPE, RMB и RealMistake; при составлении 32 параллельных выборок и выборе с помощью Meta RM он превосходит гораздо более крупные GRM только с масштабированием времени вывода. Эти результаты делают DeepSeek-GRM многообещающим кандидатом для локального развертывания, особенно вариантов 16B и 27B.…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: BBQGOD
Теги: deepseek_v2, conversational, custom_code, zh, en, text-generation-inference, endpoints_compatible
Лайков: 5  |  Загрузок: 43

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.