- Я всё таки решил не использовать .NET для этого. У Python гораздо богаче экосистема.
- В качестве модели для обучения выбрал XGBoost.
- Модели требовались признаки (features). Признак — это некоторый измеримый параметр объекта, по которому модель может обучаться, а затем прогнозировать результат. Я отобрал 15 признаков.
- Например, чуть ранее я упоминал Sommina — артиста, который публикует 90+ релизов в день. Частота релизов — это один из признаков. У ИИ-артистов он выше, у обычных — ниже.
- Другой признак, который я обнаружил, это связь артистов с лейблами. Я заметил, что лейбл, сотрудничающий с одним ИИ-артистом, с большой долей вероятности сотрудничает и с другими ИИ-артистами. Например, Sommnia сотрудничает с лейблом Context Collapse, который, в свою очередь сотрудничает с множеством других ИИ-артистов (278, если быть точным).
- В обучении использовал метаданные артистов, начиная с 2024 года. Таких набралось 572 тысячи. 60% использовались непосредственно для обучения, 20% на тестирование и ещё 20% на калибровку.
- Матрица ошибок (confusion matrix) получилась следующая:
| | Предсказано не ИИ | Предсказано ИИ |
| ----- | ----------------- | -------------- |
| Не ИИ | 96740 | 2784 |
| ИИ | 423 | 14370 |
- Из всех, кого модель назвала ИИ, 83.77% действительно оказались ИИ. Из всех ИИ-артистов модель нашла 97.14%.
- Применив модель к артистам из "серой" категории (которых нет на Deezer), получилось, что ещё около 64 тысячи исполнителей с высокой вероятностью (≥ 0.85) можно отнести к ИИ. Они, в свою очередь, добавили ещё 129 тысяч ИИ-треков c января по апрель этого года.
- По моим скромным подсчётам, получается, что на "Яндекс Музыке" сейчас примерно 140 тысяч ИИ артистов. Ежемесячно они загружают около 40% новой музыки.