Это версия модели Mistral-7b до DPO, настроенная с помощью https://github.com/jondurbin/bagel. Вероятно, вам нужна более производительная модель, прошедшая DPO: https://huggingface.co/jondurbin/bagel-dpo-7b-v0.1 Единственное преимущество этой модели заключается в том, что она менее «правдива» для ролевых игр и других типов сценариев, которые могут получить больше пользы от настройки только SFT. Первым шагом в этом процессе является создание набора данных. В этом случае мы фактически создаем составной набор данных, состоящий как из данных контролируемой точной настройки (SFT), так и из данных прямой оптимизации предпочтений (DPO). Все данные инструкций, то есть данные, которые не являются обычным текстом (например, проект Gutenberg и элементы из Cinematika) или DPO, преобразуются в формат ShareGPT, чтобы с ними было проще работать. См. соответствующий код в файле Bagel/datasources/.py в репозитории, указанном выше, для полной реализации для каждого источника данных. Дедупликация осуществляется путем создания uuid v5 инструкции/текста с последующим добавлением только ранее не встречавшихся элементов (где наборы данных загружаются в порядке оценки достоверности, которую я им присваиваю). Это означает, что если инструкция находится в источнике данных «Foo» с достоверностью 4, а также в источнике данных «Bar» с…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: jondurbin
Теги: mistral, conversational, text-generation-inference, endpoints_compatible
Лайков: 26 | Загрузок: 478
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.