Penguin-VL изучает пределы эффективности VLM с помощью кодировщиков машинного зрения на основе LLM. Страница проекта: penguin-vl.github.io | GitHub: tencent-ailab/Penguin-VL | arXiv: 2603.06569 PenguinVL — это компактная модель визуального языка, предназначенная для изучения пределов эффективности небольших VLM. PenguinVL — это не просто модель, настроенная на инструкции, а построенная с нуля за счет построения видеокодера на основе LLM, мультимодального предварительного обучения и последующей настройки инструкций. В отличие от большинства существующих VLM, которые полагаются на предварительно обученные с помощью контрастирования видеокодеры (например, CLIP/SigLIP), PenguinVL инициализирует свой видеокодер непосредственно из текстового LLM. Такая конструкция позволяет избежать объективного несоответствия между контрастным обучением и авторегрессионным языковым моделированием, обеспечивая более четкое согласование между визуальными представлениями и языковой основой. — 🧠 Vision Encoder на основе LLM. Vision Encoder адаптирован на основе предварительно обученного текстового LLM (Qwen3-0.6B), модифицированного двунаправленным вниманием и 2D-RoPE для пространственного моделирования. Это обеспечивает сильные семантические априоры и встроенную совместимость с последующим LLM. — 🎥 Эффективное видео. Понимание стратегии сжатия токенов с учетом временной избыточности (TRA)…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: tencent
Теги: penguinvl_qwen3, multi-modal, large-language-model, vision-language-model, vision-encoder, conversational, custom_code, en
Лайков: 35 | Загрузок: 3,399
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.