Llama2-13B-RLHF-RM — это языковая модель с 13 миллиардами параметров (с контекстом до 4096 токенов), используемая в качестве модели вознаграждения при обучении NV-Llama2-70B-RLHF-Chat, которая достигает 7,59 на MT-Bench и демонстрирует высокие результаты в академических тестах. Начиная с базовой модели Llama2-13B, она сначала настраивается с помощью инструкций с помощью NVIDIA SFT Datablend v1 [^1], а затем обучается на наборе данных HH-RLHF с целью моделирования вознаграждения. Учитывая разговор с несколькими ходами между пользователем и помощником, он присваивает оценку предпочтения последнему ходу помощника. Llama2-13B-RLHF-RM обучен с помощью NVIDIA NeMo-Aligner, масштабируемого набора инструментов для производительного и эффективного выравнивания моделей. NeMo-Aligner создан с использованием NeMo Framework, которая позволяет масштабировать обучение до тысяч графических процессоров с использованием тензорного параллелизма, параллелизма данных и конвейеров для всех компонентов выравнивания. Все наши контрольные точки перекрестно совместимы с экосистемой NeMo, что позволяет выполнять развертывание логических выводов и дальнейшую настройку. [^1]: а также около 5 тыс. собственных точек данных, которые мы не можем опубликовать из-за ограничений поставщиков данных. Обучение модели вознаграждения является важным компонентом обучения с подкреплением на основе обратной связи между людьми (RLHF). Развивая…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: nvidia
Теги: nemo, nvidia, llama2, en
Лайков: 4 | Загрузок: 34
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.