Тип модели: MLM-Filter-13b — это MLLM с открытым исходным кодом, обученный оценивать качество парных данных изображения и текста. Он может генерировать 4 показателя качества для данных «изображение-текст»: «Сопоставление текста изображения», «Выполнение деталей объекта», «Качество текста подписи» и «Семантическое понимание». Бумага или ресурсы для получения дополнительной информации: https://mlm-filter.github.io/ Llama 2 лицензируется в соответствии с лицензией сообщества LLAMA 2, авторские права (c) Meta Platforms, Inc. Все права защищены. Куда отправлять вопросы или комментарии о модели: https://github.com/Victorwz/MLM_Filter/issues. Основное предполагаемое использование: MLM-Filter можно использовать в качестве замены CLIPScore в следующих задачах: 1. Оценка данных изображения-текста в крупномасштабном наборе данных перед обучением, а затем фильтрация высококачественных подмножеств на основе оценок (для обучения MLLM или VLM рассмотрите возможность совместного использования изображения-текста). Оценка соответствия и оценка выполнения деталей объекта); 2. Оценить выравнивание изображения-текста для моделей генерации изображения2текста или текста2изображения; 3. Любые потенциальные приложения с необходимостью расчета выравнивания изображения-текста. — 46 тыс. инструкций, выбранных из данных LLaVA-1.5 665 тыс. — 4К инструкции по задачам оценки качества графически-текстовых данных в диапазоне 4…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: weizhiwang
Теги: llava, endpoints_compatible
Лайков: 6 | Загрузок: 4
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.