Квен-Аудио 🤖 | 🤗  | Qwen-Audio-Chat 🤖 | 🤗    Демо  |   Домашняя страница  |  Paper Qwen-Audio (Qwen Large Audio Language Model) — это мультимодальная версия большой серии моделей Qwen (сокр. Tongyi Qianwen), предложенной Alibaba Cloud. Qwen-Audio принимает разнообразный звук (человеческую речь, естественный звук, музыку и песни) и текст в качестве входных данных и выводит текст. Вклад Qwen-Audio включает в себя: — Фундаментальные аудиомодели: Qwen-Audio — это фундаментальная многозадачная аудио-языковая модель, которая поддерживает различные задачи, языки и типы аудио и служит универсальной моделью понимания звука. Опираясь на Qwen-Audio, мы разрабатываем Qwen-Audio-Chat путем тонкой настройки инструкций, обеспечивая возможность многоповоротных диалогов и поддержку разнообразных аудио-ориентированных сценариев. — Структура многозадачного обучения для всех типов аудио: чтобы расширить предварительное обучение аудиоязыку, мы решаем проблему вариаций в текстовых метках, связанных с различными наборами данных, предлагая структуру многозадачного обучения, позволяющую обмениваться знаниями и избегать помех «один-ко-многим». Наша модель включает более 30 задач, и обширные эксперименты показывают, что модель обеспечивает высокую производительность. -…
Модальности:
Генерация текста Мультимодальность
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: xun
Теги: qwen, multimodal, 音频理解, custom_code, zh, en, 4-bit, gptq
Лайков: 4 | Загрузок: 7
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.