ziniuli/Mistral-7B-ReMax-v0.1 - Каталог нейросетей
Генерация текста

ziniuli/Mistral-7B-ReMax-v0.1

Добавлено:
ziniuli/Mistral-7B-ReMax-v0.1

Модель большого языка Mistral-7B-ReMax-v0.1 (LLM) представляет собой усовершенствованную версию Mistral-7B-Instruct-v0.2 с подкреплением обучения на основе человеческих предпочтений (RLHF). Алгоритм тонкой настройки — ReMax. Подробности алгоритма можно найти в статье. — Разработчик: Ziniu Li — Лицензия: apache-2.0 — Доработано на основе Mistral-7B-Instruct-v0.2. Формат инструкций такой же, как у Mistral-7B-Instruct-v0.2. В частности, приглашение должно быть окружено токенами [INST] и [/INST]. 10 тысяч запросов из набора данных lmsys-chat-1m. Обратите внимание, что никакие ответы из этого набора данных не используются при обучении. Важно: УльтраРМ-13б использует другой шаблон инструкции, чем Мистраль-7Б. Чтобы решить эту проблему, мы меняем шаблон чата на шаблон UltraRM-13b при оценке вознаграждения при тонкой настройке RLHF. Алгоритм обучения — ReMax, подробности о котором доступны в статье, а реализации — в репозитории. Поскольку мы настраиваем Mistral-7B-Instruct-v0.2 с помощью набора данных lmsys-chat-1m, мы сначала оцениваем качество ответов. Мы случайным образом выбираем 500 запросов из набора данных lmsys-chat-1m и позволяем моделям генерировать ответы. Затем мы позволяем GPT-4 оценить битрейт выигрыша. …

Модальности:
Генерация текста


Задача: Генерация текста
Автор: ziniuli
Теги: mistral, en, text-generation-inference, endpoints_compatible
Лайков: 4  |  Загрузок: 49

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.