InferenceIllusionist/Excalibur-7b-DPO - Каталог нейросетей
Генерация текста

InferenceIllusionist/Excalibur-7b-DPO

Добавлено:
InferenceIllusionist/Excalibur-7b-DPO

Первый шаг в мир тонкой настройки. Целью этого выпуска было повышение качества ответов исходной модели, в частности для сценариев использования машинного зрения* Excalibur-7b, настроенный с помощью оптимизации прямых предпочтений (DPO) с использованием Intel/orcadpopairs. Это быстрый эксперимент для определения влияния точной настройки DPO на базовую модель Excelsior-7b. Работал чуть больше часа на одном A100. Точная настройка позволила сделать модель диалоговой и более всесторонней. Оценки тестов увеличились в следующих категориях по сравнению с базовым Excelsior-7b: ARC: 69,71 -> 70,9 HellaSwag: 87,56 -> 87,93 TruthfulQA: 67,24 -> 70,82 Среднее: 73,6 -> 73,84 Точность: bfloat16 Требуется дополнительный файл mmproj. У вас есть два варианта функциональности машинного зрения (доступны в этом репозитории): Квантованный — опция с ограниченным объемом VRAM (197 МБ) * Неквантованный — вариант «Премиум» / Лучшее качество (596 МБ). Выберите файл gguf по вашему выбору в Koboldcpp, как обычно, затем обязательно выберите файл mmproj, указанный выше, в поле LLaVA mmproj подменю модели: * Для достижения наилучших результатов используйте ChatML для формата подсказки. Альпака тоже может подойти.

Модальности:
Генерация текста


Задача: Генерация текста
Автор: InferenceIllusionist
Теги: mistral, finetune, dpo, chatml, model-index, text-generation-inference, endpoints_compatible
Лайков: 8  |  Загрузок: 82

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.