apple/FastVLM-7B - Каталог нейросетей
Генерация текста

apple/FastVLM-7B

Добавлено:
apple/FastVLM-7B

FastVLM был представлен в FastVLM: эффективное кодирование машинного зрения для языковых моделей машинного зрения. (CVPR 2025) [//]: # (![FastViTHD Performance](accvslatencyqwen-2.png)) Мы представляем FastViTHD, новый гибридный кодер машинного зрения, предназначенный для вывода меньшего количества токенов и значительного сокращения времени кодирования изображений с высоким разрешением. Наш самый маленький вариант превосходит LLaVA-OneVision-0.5B благодаря более быстрому времени первого появления токена (TTFT) в 85 раз и меньшему в 3,4 раза меньшему видеокодеру. * Наши более крупные варианты, использующие Qwen2-7B LLM, превосходят недавние разработки, такие как Cambrian-1-8B, при использовании одного кодировщика изображений с TTFT в 7,9 раза быстрее. Чтобы выполнить вывод контрольной точки PyTorch, следуйте инструкциям в официальном репозитории: Чтобы выполнить вывод с помощью преобразователей, мы можем использовать TrustRemotecode вместе со следующим фрагментом: Если вы нашли эту модель полезной, процитируйте следующий документ:

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: apple
Теги: ml-fastvlm, llava_qwen2, conversational, custom_code
Лайков: 268  |  Загрузок: 1,423

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.