В прошлый раз проверялись артисты, рекомендованные Яндексом. Алгоритм был такой: начинаем с рандомного артиста и обрабатываем его. Потом переходим в "Похожие артисты" и обрабатываем их. Для каждого похожего снова переходим в "Похожие артисты" и т. д. Что-то типа BFS-алгоритма по дереву похожих артистов. В итоге, я получил датасет из 4К артистов, но этот подход был медленным из-за большого количества вызовов API.
Я пересмотрел алгоритм и вместо BFS, сейчас тупо обрататываю ID артистов последовательно один за другим. Начал с ID последнего созданного профиля артиста, который я нашёл при помощи бинарного поиска (наконец-то пригодился LeetCode). Кроме того, оптимизировал вызовы API и сейчас из Яндекса за один вызов извлекается информация по 100 артистам и сравнивается с Deezer в 4 потока. Быстрее уже не получается, т.к. упираюсь в лимиты API Deezer.
В итоге мне удалось добиться скорости примерно
UPD: Скорость примерно 20K в час.
