alexshengzhili/llava-v1.5-13b-dpo - Каталог нейросетей
Генерация текста

alexshengzhili/llava-v1.5-13b-dpo

Добавлено:
alexshengzhili/llava-v1.5-13b-dpo

Разработчики: Шэнчжи Ли (TIFIN), Жунъюй Линь (KAUST), Шичао Пей (Массачусетский университет в Бостоне) Сотрудники: TIFIN, KAUST, Массачусетский университет в Бостоне Контактная информация: alex.li@tifin.com, rongyu.lin@kaust.edu.sa, shichao.pei@umb.edu Модель llava-v1.5-13b-dpo предназначена для расширить возможности мультимодальных моделей большого языка (MLLM) по отслеживанию инструкций, особенно в сценариях, где настройка визуальной инструкции может ухудшить знание языка. В этой модели используется новый метод прямой оптимизации предпочтений (DPO) вместе с тщательно подобранным набором данных предпочтений VQA с 6 КБ для достижения превосходной производительности в мультимодальных задачах и тестах. — Основные приложения: эта модель предназначена для задач, требующих интеграции модальностей текста и изображений, включая, помимо прочего, визуальные ответы на вопросы (VQA), субтитры к изображениям и следование мультимодальным инструкциям. — Целевая аудитория: исследователи и практики в области обработки естественного языка, компьютерного зрения и мультимодального искусственного интеллекта. Модель MM-LLM-DPO была обучена с использованием облегченного (6 тыс. записей) набора данных предпочтений VQA, где ответы были аннотированы для 5 показателей качества в детальной…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: alexshengzhili
Теги: llava, endpoints_compatible
Лайков: 5  |  Загрузок: 8

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.