IVGSZ/Flash-VStream-7b - Каталог нейросетей
Генерация текста

IVGSZ/Flash-VStream-7b

Добавлено:
IVGSZ/Flash-VStream-7b

Мы предложили Flash-VStream — модель видеоязыка, имитирующую механизм памяти человека. Наша модель способна обрабатывать чрезвычайно длинные видеопотоки в режиме реального времени и одновременно отвечать на запросы пользователей. Эта модель обучена на основе данных изображения из набора данных LLaVA-1.5 и видеоданных из наборов данных WebVid и ActivityNet после LLaMA-VID, включая — 558 тысяч отфильтрованных пар изображения и текста из LAION/CC/SBU с субтитрами BLIP. — 158 КБ мультимодальных данных, генерируемых GPT, следующих за инструкциями. — 450 тыс. данных VQA, ориентированных на академические задачи. — 40 000 данных ShareGPT. — 232 тыс. пар видео-титров, выбранных из набора данных WebVid 2.5M. — 98 тысяч видео из ActivityNet с парами контроля качества из Video-ChatGPT.

Модальности:
Генерация текста


Задача: Генерация текста
Автор: IVGSZ
Теги: vstream, vision-language model, llama, video understanding, endpoints_compatible
Лайков: 17  |  Загрузок: 1,039

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.