Привет, друзья!
В прошлом посте, посвящённом задачам с собеседований, обсудили с вами метрики классификации. Как показывает практика, вторая по популярности тема - про деревья и ансамбли над ними🌳🌲🌴
Почему так? Во-первых, бустинги - самые эффективные алгоритмы на табличных данных; а во-вторых, это довольно обширная тема, в которой можно придумать много вопросов. Ловите небольшой список😁
1️⃣Какое максимальное количество листьев у бинарного дерева глубины 4?
2️⃣Назовите общие типы ансамблирования. Какое можно дать определение в этих терминах алгоритмам случайного леса и градиентного бустинга?
3️⃣Можно ли построить ансамбль из линейных регрессий? Будет ли это эффективнее ансамбля над решающими деревьями?
4️⃣В чем заключается "случайность" в алгоритме случайного леса?
5️⃣Назовите три самых популярных алгоритма бустинга (для них же существуют одноимённые библиотеки).
6️⃣В чём главный недостаток дерева решений относительно линейной регрессии? (Подсказка: подумайте, как ведут себя эти алгоритмы на тестовой выборке, диапазон значений признаков для которой шире тренировочной)
7️⃣Как изменится качество алгоритма случайного леса, если из него удалить одно решающее дерево?
8️⃣Как изменится качество бустинга, если из него удалить самое первое решающее дерево?
Пишите в комментариях, что думаете👇
На следующей неделе будем подводить итоги🙃
Удачной недели!🌺
#карьера@data_easy
Post #168
833