Итак...🥁🥁🥁 Правильные ответы на задачи из предыдущего поста!
6️⃣. Предположим, мы строим модель оттока клиентов: класс 1 == клиент уходит, класс 0 == остаётся. По результатам работы модели тем клиентам, которых модель определила как "под угрозой оттока" будут сделаны персональные скидки.
📌 Precision покажет, какая доля клиентов из тех, кому мы сделали скидку, действительно в ней "нуждались" - т.е. собирались уходить. Точность оптимизирует ошибку первого рода - т.е. количество "впустую" разосланных скидок:)
📌 Recall покажет, какую долю действительно "отточных" клиентов модель угадала. Полнота оптимизирует ошибку второго рода - т.е. число клиентов под угрозой ухода, которых мы вовремя не распознаём.
📌 F-мера является объединением precision и recall, поэтому отражает меру денег, которую мы можем заработать посредством использования модели.
2️⃣. ROC-AUC, в отличие от F-меры, не зависит от порога и показывает ранжирующую способность данных на соответствующем таргете. При расчёте ROC-AUC мы используем таргет и
3️⃣. ROC-AUC отражает вероятность того, что для случайно взятого объекта 1-го класса оценка принадлежности к классу 1 будет выше, чем для случайно взятого объекта 0-го класса.
4️⃣. Формула среднего гармонического:)
5️⃣. ROC-AUC случайного классификатора равен 0.5.
Если ROC-AUC > 0.5 - значит, у модели есть ранжирующая способность, она «не случайная», а что-то «понимает».
Если ROC-AUC < 0.5 - это, на самом деле, тоже неплохо, ранжирующая способность есть, просто в таргете перепутаны классы - если 0 и 1 поменять местами, то 0.2 превратится в 0.8.
Таким образом, самый лучший классификатор с ROC-AUC = 0.8, потом идет 0.2 (по сути то же самое, что и первый, но его нужно немного модифицировать), и потом уже случайный с метрикой 0.5.
6️⃣. Здесь правильный ответ 0.5:)
При построении графика ROC-AUC в осях TPR = TP / (TP + FN) и FPR = FP / (FP + TN) у нас получится только две различных точки: (0, 0) и (1, 1), т.к. модель при пороге < 0.8 будет возвращать все единицы, а при пороге > 0.8 все нули (попробуйте построить матрицу ошибок для обоих случаев). Соответственно, через эти две точки мы проведём прямую, площадь под которой равна 0.5.
7️⃣. Здесь верный ответ не изменится.
Значение ROC-AUC равно 0.5, когда модель не способна различать классы лучше, чем случайное угадывание - т.е. в таких случаях она фактически не использует информацию о признаках для различения классов.
Если объединить датасеты и пересчитать метрики, ROC-AUC останется 0.5, т.к. для объединённого датасета ситуация не улучшится - модель равносильна случайному алгоритму.
PS: можете рассмотреть на примере классификатора из предыдущей задачи.
8️⃣. По условию каждая модель голосует "1" или "0", поэтому возможны следующие ситуации, предшествующие принятию итогового решения:
📌 Две модели проголосовали одинаково, а решение третьей отличается: точность такой системы 0.8*0.8*0.2.
Теперь учтём, что "третьей несогласной" моделью может быть любая из них, поэтому нужно домножить полученное значение на число способов составить комбинации из {1, 1, 0}, их три: 001, 010, 100.
📌 Три модели проголосовали одинаково - точность такой системы просто 0.8*0.8*0.8.
А теперь сложим эти два случая - это и будет итоговый ответ: 3*0.8*0.8*0.2 + 0.8*0.8*0.8 = 0.896 (воспользовались правилом суммы).
Удачной недели!🤗
#карьера@data_easy