RLAIF-V-12B — это мультимодальная модель большого языка (MLLM), демонстрирующая супернадежность GPT-4V. Модель построена на базе OmniLMM из серии MiniCPM-V. Мы используем новую структуру RLAIF-V, которая объединяет MLLM в парадигму полностью открытого исходного кода. Эта структура максимально использует обратную связь с открытым исходным кодом с двух ключевых точек зрения, включая высококачественные данные обратной связи и алгоритм онлайн-обучения на основе обратной связи. 🏅 Надежность Super GPT-4V. Благодаря отзывам искусственного интеллекта с открытым исходным кодом RLAIF-V-12B достигает надежности Super GPT-4V как в генеративных, так и в дискриминативных задачах. 💪 Поддержание производительности скважины по общим возможностям: В тестах, протестированных с использованием общих возможностей (например, LLaVA Bench, MMStar), RLAIF-V-12B также демонстрирует хорошие характеристики. 🚀 Масштабирование времени вывода с помощью RLAIF-V Reward**: использование RLAIF-V 12B в качестве модели вознаграждения может еще больше улучшить производительность модели в нескольких тестах с выбором лучших из N. Это также последовательно повышает надежность различных MLLM. — Связанная модель: OmniLMM-12B — Обучение на данных: RLAIF-V-Dataset Если наша модель/код/документ окажется для вас полезным, процитируйте наши статьи 📝:
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: openbmb
Теги: omnilmm, conversational, en, endpoints_compatible
Лайков: 8 | Загрузок: 22
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.