Контрольные точки состоят из кодера языка и весов проектора мультимодальной модели LLaVA-13B, обученной с помощью нашей реализации и рецепта обучения Cerebras. Контрольные точки кодировщика изображения для этой модели можно найти по адресу cerebras/Cerebras-ViT-L-336-patch14-llava13b-ShareGPT4V. Полную информацию об этой модели и деталях обучения можно найти в нашей следующей публикации в блоге. Cerebras-Llava распространяется под лицензией сообщества LLAMA 2, авторские права (c) Meta Platforms, Inc. Все права защищены. Cerebras-LLaVA-13B — модель-трансформер со следующими деталями архитектуры кодировщика Vision: CLIP-VisionModel-Large. Он обрабатывает изображения размером 336 x 336 с размером патча 14. Большая языковая модель: предварительно обучена на основе контрольных точек Vicuna-13B, а инструкции точно настроены на различных наборах данных. * Проектор: модуль проектора, который соединяет часть кодера LLM и Vision, состоит из двух линейных слоев с активацией геля (mlp2x-gelu). Эту модель можно загрузить напрямую с помощью репозитория исходного кода LLaVa. Для установки обратитесь к инструкциям в репозитории исходного кода. Мы выполняем все наши оценки, используя сценарии репозитория исходного кода LLaVA. Основное предполагаемое использование: Основное использование LLaVA…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: cerebras
Теги: llava, endpoints_compatible
Лайков: 6 | Загрузок: 5
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.