llava-next-vicuna-7b-m3
Model type: Matryoshka Multimodal Models (M3) allow using to explicitly control visual granularities (the number of visual toknes...
Model type: Matryoshka Multimodal Models (M3) allow using to explicitly control visual granularities (the number of visual toknes...
Model type: VILA is a visual language model (VLM) pretrained with interleaved image-text data at scale, enabling multi-image...
Model type: VILA is a visual language model (VLM) pretrained with interleaved image-text data at scale, enabling multi-image...
Это объединенная модель LLAVA-MED, опубликованная на сайте https://github.com/microsoft/LLaVA-Med. Библиотека предназначена только для научных целей и не используется для...
This repository features LLaVA v1.5 trained with the Meta-Llama-3-8B-Instruct LLM. This integration aims to leverage the strengths of...
Тип модели: LLaVA-Hound — это большая мультимодальная модель видео с открытым исходным кодом, точно настроенная из видеоинструкций, следующих...
В этом репозитории представлена LLaVA v1.5, обученная с помощью Meta-Llama-3-8B-Instruct LLM. Эта интеграция направлена на использование сильных сторон...
Тип модели: NVILA — это модель визуального языка (VLM), предварительно обученная чередующимися данными изображения и текста в масштабе,...
Тип модели: VILA — это модель визуального языка (VLM), предварительно обученная с помощью чередующихся данных изображения и текста...
Модель может понимать визуальные подсказки в виде тегов на изображении (например, какой объект помечен идентификатором 9?), а также...