Чжан Ли, Бяо Ян, Цян Лю, Чжиинь Ма, Шуо Чжан, Цзинсю Ян, Ябо Сунь, Юлян Лю†, Сян Бай† Хуачжунский университет науки и технологий, Kingsoft Paper   |   Подробная подпись   |   Модель Вес   | Вес модели в WiseModel   Monkey предлагает эффективный подход к обучению, позволяющий эффективно повысить входное разрешение до 896 x 1344 пикселей без предварительного обучения с самого начала. Чтобы преодолеть разрыв между простыми текстовыми метками и высоким разрешением ввода, мы предлагаем метод генерации многоуровневого описания, который автоматически предоставляет обширную информацию, которая может помочь модели изучить контекстуальную связь между сценами и объектами. Благодаря синергии этих двух разработок наша модель достигла отличных результатов в нескольких тестах. Сравнивая нашу модель с различными LMM, включая GPT4V, наша модель демонстрирует многообещающую производительность в субтитрах к изображениям, уделяя внимание текстовой информации и улавливая мелкие детали изображений; улучшенное входное разрешение также обеспечивает замечательную производительность при обработке изображений документов с плотным текстом. — Контекстуальные ассоциации. Наш метод демонстрирует превосходную способность…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: echo840
Теги: monkey, custom_code
Лайков: 33 | Загрузок: 522
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.