По статистике на 4-х из 5-ти собеседований обязательно попадается вопрос про метрики классификации. В этой теме можно придумать много занимательных задач + таким образом можно проверить сразу знание и ML, и математики (если вопрос не просто на определение). Их сложность, как обычно, зависит от места и уровня позиции, на которую Вы претендуете🙃
Собрала небольшую подборку нетривиальных вопросов, которые мне когда-либо попадались, в начале более теоретические, внизу более практическо-математические😁
6️⃣. Интерпретируйте смысл precision, recall, F-меры? (можно взять любой пример задачи классификации и на нём объяснить что есть что)
2️⃣. В чём главное отличие ROC-AUC от F-меры? (помимо формулы для расчёта)
3️⃣. В чём вероятностный смысл ROC-AUC? (по сути тоже интерпретация)
4️⃣. По какой формуле рассчитывается F-мера для задачи мультиклассификации? (скажем, для n классов)
5️⃣. Есть 3 классификатора, их ROC-AUC 0.2, 0.5 и 0.8. Какой из них самый плохой, а какой самый эффективный?
6️⃣. Есть классификатор, который для любого объекта возвращает значение 0.8, доля положительного класса в выборке составляет 20%. Чему будет равняться его ROC-AUC?
7️⃣. Есть одна обученная модель и датасет, разделённый на 2 части: для первой предсказания модели содержат большое число 1, ROC-AUC на этом наборе данных 0.5; для второй части датасета модель предсказывает больше -1, значение ROC-AUC здесь тоже 0.5. Изменится ли ROC-AUC, если объединить датасеты и пересчитать метрики?
8️⃣. Есть 3 модели бинарной классификации, у всех accuracy равно 0.8. На их основе создаётся ансамбль следующим образом: если хотя бы две модели голосуют "1", то итоговый ответ тоже "1"; аналогично для отрицательного класса. Какое значение accuracy для такой системы?
Пишите свои варианты решения в комментарии, на следующей неделе подведём итоги🌚
Хороших выходных!🌺❄️
#карьера@data_easy
Post #158
941
- ❤🔥 7
- 👍 6
- ❤ 4
- 🔥 2
- 😱 1