Квен-Аудио 🤖 | 🤗  | Qwen-Audio-Chat 🤖 | 🤗  |    Демо 🤖 | 🤗    Главная страница  |  Бумага |  🤗 Qwen-Audio (Qwen Large Audio Language Model) — мультимодальная версия большой модельной серии Qwen (сокр. Tongyi Qianwen), предложенной Alibaba Cloud. Qwen-Audio принимает разнообразный звук (человеческую речь, естественный звук, музыку и песни) и текст в качестве входных данных и выводит текст. Вклад Qwen-Audio включает в себя: — Фундаментальные аудиомодели: Qwen-Audio — это фундаментальная многозадачная аудио-языковая модель, которая поддерживает различные задачи, языки и типы аудио и служит универсальной моделью понимания звука. Опираясь на Qwen-Audio, мы разрабатываем Qwen-Audio-Chat посредством тонкой настройки инструкций, обеспечивающей многоповоротные диалоги и поддержку разнообразных аудио-ориентированных сценариев. — Структура многозадачного обучения для всех типов аудио: чтобы расширить предварительное обучение аудиоязыку, мы решаем проблему вариаций в текстовых метках, связанных с различными наборами данных, предлагая структуру многозадачного обучения, позволяющую обмениваться знаниями и избегать помех «один-ко-многим». Наша модель включает в себя более 30 задач, и обширные эксперименты показывают, что модель достигает высоких результатов…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Qwen
Теги: qwen, audio-text-to-text, custom_code, zh, en
Лайков: 146 | Загрузок: 2,215
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.