H2OVL-Mississippi-800M — это компактная, но мощная модель языка видения от H2O.ai, имеющая 0,8 миллиарда параметров. Несмотря на свой небольшой размер, он обеспечивает самую современную производительность в распознавании текста, превосходя его в сегменте распознавания текста OCRBench и превосходя в этой области гораздо более крупные модели. Созданный на основе надежной архитектуры наших языковых моделей H2O-Danube, Mississippi-800M расширяет их возможности за счет плавной интеграции задач машинного зрения и речи. — 0,8 миллиарда параметров: баланс между производительностью и эффективностью, что делает его пригодным для оптического распознавания символов и обработки документов. — Модель, обученная на 19 миллионах пар изображение-текст, с упором на распознавание текста, понимание документов и интерпретацию диаграмм, рисунков и таблиц, оптимизирована для обеспечения превосходной производительности распознавания. В этом руководстве показано, как создавать запросы для извлечения информации и преобразования ее в структурированные выходные данные JSON. Он начинается с базовых примеров и переходит к более сложным структурам JSON, включая обработку данных из изображений таблиц и диаграмм. Цель — помочь пользователям разработать эффективные подсказки, которые можно использовать в различных приложениях, таких как обработка естественного языка, чат-боты или…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: h2oai
Теги: h2ovl_chat, feature-extraction, gpt, llm, multimodal large language model, ocr, conversational, custom_code
Лайков: 39 | Загрузок: 1,197,953
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.