NV-Llama2-70B-RLHF-Chat — это модель генеративного языка с 70 миллиардами параметров, настроенная на модели LLama2-70B. Он принимает входные данные с длиной контекста до 4096 токенов. Модель была настроена для инструкций с использованием контролируемой точной настройки (SFT) на NVIDIA SFT Datablend v1 [^1] и обучения с подкреплением на основе обратной связи с человеком (RLHF) на наборе данных HH-RLHF, достигнув 7,59 на MT-Bench и продемонстрировав высокие результаты в академических тестах. NV-Llama2-70B-RLHF-Chat обучен с помощью NVIDIA NeMo-Aligner, масштабируемого набора инструментов для производительного и эффективного выравнивания моделей. NeMo-Aligner создан с использованием NeMo Framework, которая позволяет масштабировать обучение до тысяч графических процессоров с использованием тензорного параллелизма, параллелизма данных и конвейеров для всех компонентов выравнивания. Все наши контрольные точки перекрестно совместимы с экосистемой NeMo, что позволяет выполнять развертывание логических выводов и дальнейшую настройку. Попробуйте эту модель прямо сейчас и бесплатно, размещенную на NVIDIA AI Playground. Вы можете использовать это в предоставленном пользовательском интерфейсе или через API с ограниченным доступом (до 10 000 запросов в течение 30 дней). Если вам понадобится больше запросов, ниже мы покажем, как настроить сервер вывода. [^1]: а также ~5 тысяч проприетарных…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: nvidia
Теги: nvidia, conversational, llama2, rlhf, en
Лайков: 5 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.