Этот репозиторий содержит контрольную точку модели VLM2Vec-Phi3.5V для VLM2Vec: обучение моделей языка видения для задач массового мультимодального внедрения. В данной работе мы поставили перед собой цель построить единую мультимодальную модель встраивания для любых задач. Наша модель основана на преобразовании существующей хорошо обученной VLM (Phi-3.5-V) во встроенную модель. Основная идея состоит в том, чтобы добавить токен [EOS] в конец последовательности, который будет использоваться в качестве представления мультимодальных входных данных. Наша модель обучается на MMEB-train и оценивается на MMEB-eval с контрастным обучением. Для обучения мы используем только пакетные негативы. Наши лучшие результаты были основаны на обучении Lora с размером пакета 1024. У нас также есть контрольная точка с полным обучением с размером пакета 2048. Наши результаты по 36 наборам оценочных данных: VLM2Vec-Qwen2VL (7B) — VLM2Vec-Qwen2VL (2B) — VLM2Vec-LLaVa-Next — VLM2Vec-Phi3.5V Наша модель может значительно превосходить существующие базовые показатели. Затем вы можете войти в каталог и выполнить следующую команду. «` @article{jiang2024vlm2vec, title={VLM2Vec: Обучение…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: TIGER-Lab
Теги: phi3_v, Embedding, conversational, custom_code, en
Лайков: 11 | Загрузок: 22
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.