Модель вознаграждения, представленная в статье «Обучение по предпочтениям, раскрывает навыки психоконсультирования выпускников LLM». Это тщательно настроенная модель мета-ламы/ламы-3.1-8B-Instruct, обученная с использованием изучения предпочтений на наборе данных PsychoCounsel-Preference. Эта политическая модель PsychoCounsel-Llama3-8B, обученная с помощью этой модели с онлайн-обучением предпочтений, достигает впечатляющего процента побед в 87% против GPT-4o в задачах психоконсультирования.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Psychotherapy-LLM
Теги: llama, conversational, text-generation-inference, endpoints_compatible
Лайков: 7 | Загрузок: 21
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.