👀 Недавно прочитал статью Валерия Бабушкина (https://www.linkedin.com/in/venheads/), про неоднозначность precision в продакшн‑сценариях вроде фрода или спама. Метрика выглядит хорошо на бумаге, но при изменении доли позитивного класса может сильно упасть, хотя TPR/FPR остаются стабильными.
💻 У меня был кейс с внедрением NLP-модели для проверки заявок в кредитном скоринге: на тесте precision была почти 0.9, но при росте объёма заявок и изменении их качества фактический «хороший» результат по бизнес-KPI упал в два раза. Переключились на фиксированную специфичность и максимизацию recall, и модель стала стабильно полезной в продакшне.
🚩Вывод: для систем с редкими событиями лучше смотреть на TPR/FPR или recall при фиксированной специфичности, а не на precision как на главный ориентир.
Статья: https://www.linkedin.com/pulse/why-precision-dangerous-metric-valerii-babushkin/?trackingId=4ANfb3R7Tc8nEiTB2rHz5A%3D%3D
Post #92
593