🚀 Med-PRM-Reward — одна из первых моделей процессного вознаграждения (PRM), специально разработанных для медицинской сферы. В отличие от обычных PRM, он расширяет свои возможности проверки за счет интеграции клинических знаний посредством генерации с расширенным поиском (RAG). Med-PRM-Reward демонстрирует исключительную производительность при масштабировании вычислений за время тестирования, особенно превосходя ансамбли с большинством голосов при решении сложных медицинских задач. Более того, его масштабируемость не ограничивается Llama-3.1-8B-Instruct: он обеспечивает столь же выдающиеся результаты при масштабировании вычислений времени испытаний для множества других моделей, специализирующихся на медицине. Примечательно, что в сочетании с llama-3-meerkat-8b-v1.0 она стала первой структурой модели 8B, превзошедшей 80 баллов по тесту MedQA (4 варианта). 📄 Документ: Med-PRM-Reward: модели медицинского рассуждения с поэтапным, подтвержденным рекомендациями процессом вознаграждения. По семи медицинским критериям мы провели расчет времени тестирования с использованием решений, сгенерированных моделью политики Med-PRM, оценивая 64 решения на каждый вопрос. Если у вас есть вопросы, пишите на jhyun0414@hanyang.ac.kr.
Модальности:
Генерация текста
Области применения:
Диалог / чат Медицина
Задача: Генерация текста
Автор: dmis-lab
Теги: llama, medical, biomedical, process-reward-model, medical-ai, retrieval-augmented-generation, conversational, text-generation-inference
Лайков: 16 | Загрузок: 285
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.