UniMus/OpenJMLA - Каталог нейросетей
Генерация текста

UniMus/OpenJMLA

Добавлено:
UniMus/OpenJMLA

Маркировка музыки — это задача по прогнозированию тегов музыкальных записей. Однако предыдущие исследования по разметке музыкальных тегов в основном фокусировались на узко поставленных задачах по разметке музыкальных тегов, которые нельзя обобщать на новые теги. В этой работе мы предлагаем систему нулевой маркировки музыки, смоделированную моделью совместного музыкального и языкового внимания (JMLA), для решения проблемы маркировки музыки с открытым набором. Модель JMLA состоит из аудиокодера, смоделированного предварительно обученным автокодировщиком в маске, и декодера, смоделированного Falcon7B. Мы представляем ресемплер пресивера для преобразования звука произвольной длины в эмбеддинги фиксированной длины. Мы вводим плотные связи между уровнями кодера и декодера, чтобы улучшить поток информации между уровнями кодера и декодера. Мы собираем крупномасштабный набор данных о музыке и описаниях из Интернета. Мы предлагаем использовать ChatGPT для преобразования необработанных описаний в формализованные и разнообразные описания для обучения моделей JMLA. Предлагаемая нами система JMLA обеспечивает точность маркировки звука с нулевым выстрелом 64,82% в наборе данных GTZAN, превосходя предыдущие системы с нулевым выстрелом и достигая сопоставимых результатов с предыдущими системами в наборах данных FMA и MagnaTagATune. conda создать -имя…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: UniMus
Теги: MAELM, image-feature-extraction, audio2text, music2text, musicllm, music foundation model, custom_code, en
Лайков: 7  |  Загрузок: 456

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.