Калибровка особенно важна, когда бизнес использует именно значение вероятности.
Например, мы хотим посчитать ожидаемый убыток:
Expected Loss = PD × потенциальный размер потерь
Тогда разница между предсказанием 0.1 и 0.8 уже имеет прямой бизнес-смысл.
Получается, универсальной «лучшей метрики» для классификации просто нет.
Если нам критично найти как можно больше positive-класса, смотрим Recall.
Если хотим минимизировать количество ложных срабатываний среди выбранных объектов, смотрим Precision.
Если нужны обе характеристики, можно использовать F1.
Если бизнес способен обработать только K объектов, смотрим Precision@K и Recall@K.
Если хотим оценить качество ранжирования по всем порогам, смотрим ROC-AUC, а при сильном дисбалансе особенно полезен PR-AUC.
Если значение предсказанной вероятности само по себе участвует в бизнес-решении, проверяем калибровку.
А если можем посчитать стоимость FP и FN, выбор модели и порога можно напрямую привязать к деньгам.
Поэтому я бы начинала выбор метрики с вопроса: что именно бизнес будет делать с предсказанием модели?
P.S.
Я напортачила с форматированием🥲
#data_science
Post #368
733
- 🔥 6
- ❤ 5
- 👍 3