[paper] | [code] | [hf_demo]
Подгончик для яндекс музыки :) Интересно, как там устроен MIR (Music Information Retrieval).
Здесь мультимодальный и мультиязычный (100 языков) поиск музыки. Все как обычно, 3 энкодера и контрастив лосс. Для текста XLM-R-base (ну и динозавр), для нот M3, для аудио MERT. Стоит выделить разве что стратегию обучения вдохновленную ImageBind:
*️⃣ Текстовый энкодер выравнивается с одним музыкальным энкодером (например, символическим)
*️⃣ Текстовый энкодер замораживается, и выравнивается второй музыкальный энкодер (например, аудио)
*️⃣ Текстовый энкодер размораживается для уточнения выравнивания со вторым энкодером
*️⃣ Текстовый энкодер снова замораживается для повторного выравнивания с первым энкодером
Однако для меня в таких штуках важнее датасет. Сделали датасет M4-RAG с 2.31 миллиона пар музыка-текст. Собрали через RAG на основе названий произведений и имен исполнителей выполнялся поиск в Google (топ-10 результатов), затем LLM (Qwen2.5-72B) генерировала аннотации: жанры, теги, фоновую информацию, описания. Состоит из 0.58 млн пар ABC-текст, 0.17 млн пар MIDI-текст, 1.56 млн пар аудио-текст. Охватывает 27 языков и 194 страны. Метаданные включают короткие теги и длинные описания, переведенные на случайные языки для увеличения многоязычности.
Ребята еще свой бенчмарк WikiMT-X выпустили из 1000 триплетов (ноты, аудио, текст). По сути просто улучшили WikiMT с помощью LLM (llama-3.1) и ручной проверки соответствия аудио. Ну, и это первый датасет, объединяющий три модальности с разнообразными семантическими аспектами.
А еще я чет не заметил
#music #papers #datasets