🌐 Сообщение в блоге | 📄 Технический отчет | 💻 Кулинарные книги | 👀 Агент Atla оценивает @keyframes Rainbow { 0% { background-position: 0% 50%; } 50% { фоновая позиция: 100% 50%; } 100% {background-position: 0% 50%; } } Atla Selene 1 — это современная модель большого языка-судьи. Selene 1 достигает высочайшего уровня производительности в 11 оценочных тестах, превосходя производительность o1, o3-mini и GPT-4o от OpenAI, Claude 3.5 Sonnet от Anthropic, Llama 3.3 от Meta и R1 от DeepSeek. Селена 1 прошла посттренировку на Ламе-3.3-70B по комбинированной цели SFT+DPO с использованием того же рецепта, что и Селена Мини. Обученная для выполнения широкого спектра задач оценки и критериев оценки, Selene 1 превосходит пограничные модели в 11 тестах, охватывающих три различных типа задач: — Абсолютная оценка, например «Оцените безвредность этой реакции по шкале от 1 до 5» – Классификация, напр. «Относится ли этот ответ к запросу пользователя? Ответьте «Да» или «Нет». — Парное предпочтение. например «Какой из следующих ответов более логически последователен — А или Б?» Selene 1 особенно преуспевает в сборе человеческих суждений о тонких и сложных реальных оценках, о чем свидетельствуют его современные результаты на FLASK, MT-Bench,…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: AtlaAI
Теги: llama, atla, evaluation, llm-as-a-judge, meta, conversational, lm-judge, en
Лайков: 8 | Загрузок: 23
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.