Это японская Vision-Language Model (VLM), разработанная NABLAS. Он поддерживает ввод изображений, нескольких изображений и видео. Эта модель представляет собой японскую Vision-Language Model (VLM), разработанную NABLAS, предназначенную для понимания и генерации текста на основе визуальных входных данных. Он поддерживает широкий спектр форматов ввода, включая отдельные изображения, несколько изображений и видео, что позволяет использовать универсальные приложения для различных мультимодальных задач. — Разработано: NABLAS — Финансируется: GENIAC — Предоставлено: NABLAS — Тип модели: VLM (Image/Multi-images/Video) — Язык(и) (NLP): Японский/Английский — Лицензия: Apache License 2.0 — Отлажено по модели: microsoft/phi-4, HuggingFaceM4/siglip-so400m-14-980-flash-attn2-navit Мы оценили модель с помощью llm-jp-eval-mm, a com Результаты по десяти широко используемым мультимодальным бенчмаркам обобщены ниже. — Repository: https://github.com/nablas-inc/NABLA-VL — Paper: WIP  > Видео, использованное в нашей демонстрации, получено от Pexels и создано Магдой…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: nablasinc
Теги: nabla_vl, conversational, ja, endpoints_compatible
Лайков: 3 | Загрузок: 87
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.