1. Краткое описание модели 2. Использование 3. Ограничения 4. Обучение 5. Лицензия 6. Цитирование В отличие от lmms-lab/LLaVA-NeXT-Video-7B-Qwen2, это модель 7B, обученная только на LLaVA-Video-178K, на основе языковой модели Qwen2 с контекстным окном из 32 000 токенов. Эта модель поддерживает до 110 кадров и достигает результатов, сравнимых с результатами lmms-lab/LLaVA-Video-7B-Qwen2 с точки зрения видеотестов. — Страница проекта: Страница проекта. — Бумага: Для получения более подробной информации ознакомьтесь с нашей статьей. — Репозиторий: LLaVA-VL/LLaVA-NeXT. — Контактное лицо: Юаньхан Чжан. — Языки: английский, китайский. Модель прошла обучение на LLaVA-Video-178K и имеет возможность взаимодействовать с видео. Мы предоставляем простой процесс генерации для использования нашей модели. Для получения более подробной информации вы можете обратиться к Github. — Архитектура: SO400M + Qwen2 — Инициализированная модель: lmms-lab/llava-onevision-qwen2-7b-si — Данные: только видеоданные, 1 эпоха, полная модель — Точность: bfloat16 — Графические процессоры: 256 Nvidia Tesla A100 (для обучения всей серии моделей) — Оркестровка: Huggingface Trainer — Нейронные сети:** PyTorch @misc{zhang2024videoinstructiontuningsynthetic, title={Видеоинструкция по настройке с использованием синтетических данных}, автор={Юаньхан Чжан, Цзиньмин Ву, Вэй Ли и…
Модальности:
Генерация текста Мультимодальность
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: lmms-lab
Теги: llava, multimodal, conversational, en, model-index, endpoints_compatible
Лайков: 5 | Загрузок: 219
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.