Llama-3.1-Nemotron-70B-Instruct — это большая языковая модель, настроенная NVIDIA для повышения полезности ответов, генерируемых LLM, на запросы пользователей. Эта модель достигает Arena Hard 85,0, AlpacaEval 2 LC 57,6 и GPT-4-Turbo MT-Bench 8,98, которые, как известно, прогнозируют LMSys Chatbot Arena Elo. По состоянию на 1 октября 2024 года эта модель занимает первое место во всех трех тестах автоматического выравнивания (проверенная вкладка для AlpacaEval 2 LC), обгоняя сильные передовые модели, такие как GPT-4o и Сонет Клода 3.5. По состоянию на 24 октября 2024 года модель имеет рейтинг Эло 1267 (+-7), 9-е место и 26-е место с контролируемым стилем в таблице лидеров ChatBot Arena. Эта модель была обучена с использованием подсказок RLHF (в частности, REINFORCE), Llama-3.1-Nemotron-70B-Reward и HelpSteer2-Preference на модели Llama-3.1-70B-Instruct в качестве начальной политики. Llama-3.1-Nemotron-70B-Instruct-HF был преобразован из Llama-3.1-Nemotron-70B-Instruct для поддержки его в кодовой базе HuggingFace Transformers. Обратите внимание, что результаты оценки могут немного отличаться от результатов оценки Llama-3.1-Nemotron-70B-Instruct в NeMo-Aligner, на которых основаны приведенные ниже результаты оценки. Попробуйте хостинговый логический вывод бесплатно на build.nvidia.com — он есть…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: nvidia
Теги: llama, nvidia, llama3.1, conversational, en, text-generation-inference
Лайков: 2,061 | Загрузок: 5,879
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.