Post #242
423
Оставим разборки в стороне. Вот что следует помнить. Обе метрики рассчитываются из матрицы ошибок, перебирая пороги отсечки. ROC кривая строится как TPR (доля истинно-положительных предсказаний == recall) vs FPR (доля ложно-положительных предсказаний), а PR кривая как precision vs recall. Т.к. recall - доля верно предсказанных элементов положительного класса, среди всех элементов этого класса, она не зависит от его размера. FPR то же самое, что 1 минус recall отрицательного класса. Это делает ROCAUC независимым от размера обоих классов, т.е. от дисбаланса и одновременно является проблемой когда не хотим считать классы равноценными при выборе лучшей модели. Расчет precision учитывает истинные ответы положительного класса и ложные отрицательного, и напрямую зависит от размеров обоих классов. Чем меньше положительных примеров в исходной выборке, тем меньше PRAUC. Вывод: улучшение ROCAUC != улучшению PRAUC. Если хотите, несмотря на дисбаланс, учитывать оба класса в равной степени, то выбирайте ROCAUC, а если важна чувствительность к размеру классов, лучше PRAUC.
- 🔥 2
- 👍 1