Модели Insight-V представляют собой модели параметров 7B на основе языковой модели LLaMA3-8B с контекстным окном из 32K токенов. Insight-V предлагает 1) масштабируемый конвейер генерации данных для длинноцепочечных высококачественных данных рассуждений, 2) многоагентную систему, которая разлагает задачи визуального рассуждения на рассуждения и обобщение, и 3) двухэтапный учебный конвейер для расширения возможностей визуального рассуждения. Вместе эти вклады решают ключевые проблемы визуального рассуждения, обеспечивая прочную основу для будущих исследований в области рассуждений MLLM. — Repository: https://github.com/dongyh20/Insight-V — Languages: English, Chinese — Paper: https://arxiv.org/abs/2411.14432 — Architecture: Pre-trained Oryx-ViT LLaMA3-8B — Data: a mix of 200k reasoning data — Precision: BFloat16 — Hardware: 64 NVIDIA Tesla A100 — Orchestration: HuggingFace Trainer — Code:** Pytorch
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: THUdyh
Теги: llava, conversational, en, zh
Лайков: 4 | Загрузок: 15
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.