omni-research/Tarsier-34b - Каталог нейросетей
Генерация текста

omni-research/Tarsier-34b

Добавлено:
omni-research/Tarsier-34b

Тип модели: Tarsier-34b — это крупномасштабная модель видеоязыка с открытым исходным кодом, которая предназначена для создания высококачественных описаний видео, а также хороших возможностей общего понимания видео (результаты SOTA по 6 открытым тестам). Бумага или ресурсы для получения дополнительной информации: — репозиторий github: https://github.com/bytedance/tarsier — ссылка на документ: https://arxiv.org/abs/2407.00634 Куда отправлять вопросы или комментарии о модели: https://github.com/bytedance/tarsier/issues Основное предполагаемое использование: Основное использование Tarsier — исследование больших мультимодальных моделей, особенно описание видео. Основные предполагаемые пользователи. Основными предполагаемыми пользователями модели являются исследователи и любители компьютерного зрения, обработки естественного языка, машинного обучения и искусственного интеллекта. Тарсьер предлагает двухэтапную стратегию обучения. — Этап-1: Многозадачное предварительное обучение на данных 13M. — Этап-2: Настройка многогранных инструкций на данных 500K. На обоих этапах мы замораживаем ViT и обучаем все параметры проекционного слоя и LLM. — Сложный набор данных описания видео: DREAM-1K — VQA с множественным выбором: MVBench, NeXT-QA и Egoschema — Открытый VQA: MSVD-QA, MSR-VTT-QA, ActivityNet-QA и TGIF-QA — Видео…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: omni-research
Теги: llava, video LLM, conversational, endpoints_compatible
Лайков: 19  |  Загрузок: 4

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.