Эта модель представлена в статье MGM-Omni: Масштабирование Omni LLM для персонализированной речи с большим горизонтом. MGM-Omni — это омни-чат-бот, способный обрабатывать текстовые, изображения, видео и речевые входные данные, а также генерировать как текстовые, так и речевые ответы. MGM-Omni способен понимать и генерировать длинную речь, а также выполнять нулевое клонирование голоса как на китайском, так и на английском языке. MGM-Omni-7B — это компонент MLLM MGM-Omni для всемодального восприятия. Для части SpeechLM см. MGM-Omni-TTS. — Поддержка омникальности: MGM-Omni поддерживает ввод аудио, видео, изображений и текста, понимает длинные контексты и может генерировать как текстовый, так и речевой вывод, что делает его по-настоящему универсальным мультимодальным помощником искусственного интеллекта. — Понимание длинной речи: в отличие от большинства существующих мультимодальных моделей с открытым исходным кодом, которые обычно терпят неудачу при вводе данных длительностью более 15 минут, MGM-Omni может обрабатывать речевой ввод продолжительностью в час, обеспечивая при этом превосходное общее и детальное понимание и производительность! — Генерация длинной речи: благодаря сокровищнице обучающих данных и интеллектуальному декодированию на основе фрагментов MGM-Omni может генерировать более 10 минут плавной, естественной речи для непрерывного рассказывания историй. — Генерация потокового вещания: Спасибо…
Модальности:
Генерация текста Мультимодальность
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: wcy1122
Теги: MGMOmni, multimodal, conversational, en, zh, endpoints_compatible
Лайков: 5 | Загрузок: 33
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.