Если вы считаете эту модель полезной, поставьте ей лайк и отметьте нас на https://github.com/LianjiaTech/BELLE! 夾区目前已经有很多多模态大语言模型相关开源工作,但大多以英文能力为主,比如LL ava, CogVLM, версия VisualGLM-6B, Qw en-VL的语言模型基座均较小,实际应用中很难兼顾视觉和语能力,因此Belle -VL 选择基于更强的语言模型基座来扩展模型的视觉能力, 为社区提供更加灵活的选择。在模型结构方面,我们主要参考的Qwen-VL模型,原始Qw en-VL是基于Qwen7B模型训练而来,基座能力相对较弱,因此Belle-VL将语言模型扩展成了Qwen14B-cha t, 在中文语言能力和视觉能力方面可以兼顾,具备更好的扩展性.原始Qwen-vl采用了三阶段的训练方式,包括预训练、多任务训练和指令微调,依赖较大的数据和机器资源。 Версия LLava1.5 доступна в версии 1.5, а также в версии LLava 1.5.加重要, 因此我们采用了两阶段的训练方式, 如下图所示: !Traing_stage 预训练数据**:预训练数据主要是基于LLava Flickr30k-CNA, AI Challenger 随机选取的100k数据多模态指令数据**:指令微调阶段,数据主要来自LLava, LRV-Instruction, LLaVAR,LVIS-INSTRUCT4V 等开源项目,我们也对其中部分数据进行了翻译,在此真诚的感谢他们为开源所做出的贡献! MME может работать в режиме реального времени, в том числе в режиме реального времени. 。它在总共14个子任务上测量感知和认知能力,包括包括存在性、计数、位置、颜色、海报、名人、场景、地标、艺术作品、OCR、常识推理、数值计算、文本翻译和代码推理等。目前最新的的BELLE-VL, код LLava и Qwen-VL.当前模型仅基于开源数据训练,仍存在不足,用户可基于自身需要继续微调强化Пожалуйста, ссылайтесь на нашу статью и GitHub при использовании нашего кода, данных или модели.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: BELLE-2
Теги: qwen, custom_code
Лайков: 28 | Загрузок: 17
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.