В комментариях на Хабре посоветовали обратить внимание на бенчмарк Echoes
Все эти классификаторы сильно зависят от датасетов и, в частности, от модели генератора музыки.
Представьте, что ваш классификатор обучен находить шарики с синими полосками из кучи разноцветных шариков. В какой-то момент, в куче появляются шарики с красными полосками и всё, приехали. Ваш классификатор их не видит. Вам нужно собрать датасет из новых шариков и дообучить модель.
То же самое с музыкой. У разных генераторов артефакты могут отличаться. И классификатор обученный на треках одного генератора, может ошибаться на треках другого.
Как заявляют авторы статьи и бенчмарка:
Echoes - самый сложный датасет. Классификаторы, обученные на существующих датасетах (например, SONICS), хуже определяют ИИ-музку из Echoes. И наоборот, обучив классификатор на Echoes, результаты становятся точнее.
Echoes содержит в себе 3577 треков от 10 генераторов музыки: Suno, Udio, DiffRhythm, Stable Audio, AudioLDM, SongGen, Brev, Mubert, AceStep, Riffusion. А тот же SONICS, о котором я рассказывал в статье, содержит треки всего от 2 генераторов: Suno и Udio.
Я проверил свой алгоритм на Echoes. Методология следующая:
- ИИ-музыка из датасета Echoes (3577 треков).
- Обычная музыка из датасета FMA Small (8000 треков).
- Балансировка классов из-за неравного количества треков в датасетах.
- Тестовый сплит 80:20.
Результаты на диаграмме. Хуже всего классификатор определяет Mubert — всего 26%. По-сути, он не способен определить треки от этого генератора. Почему так — это тема для отдельного исследования. Скорее всего, там нет checkerboard artifacts. Но наверняка есть что-то другое.
В остальном, результаты хорошие. Общая точность составляет 98.44%.
Post #344
395


- 🔥 8
- ❤ 2
- 🖕 2