FastVLM был представлен в FastVLM: эффективное кодирование машинного зрения для языковых моделей машинного зрения. (CVPR 2025) [//]: # () Мы представляем FastViTHD, новый гибридный кодер машинного зрения, предназначенный для вывода меньшего количества токенов и значительного сокращения времени кодирования изображений с высоким разрешением. Наш самый маленький вариант превосходит LLaVA-OneVision-0.5B благодаря более быстрому времени первого появления токена (TTFT) в 85 раз и меньшему в 3,4 раза меньшему видеокодеру. * Наши более крупные варианты, использующие Qwen2-7B LLM, превосходят недавние разработки, такие как Cambrian-1-8B, при использовании одного кодировщика изображений с TTFT в 7,9 раза быстрее. Чтобы выполнить вывод контрольной точки PyTorch, следуйте инструкциям в официальном репозитории: Чтобы выполнить вывод с помощью преобразователей, мы можем использовать TrustRemotecode вместе со следующим фрагментом: Если вы нашли эту модель полезной, процитируйте следующий документ:
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: apple
Теги: ml-fastvlm, llava_qwen2, conversational, custom_code
Лайков: 268 | Загрузок: 1,423
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.