TGViewer
EasyData EasyData @data_easy · 1.46K subscribers
Post #170 991
Привет, друзья!
Итак, ответы на вопросы про деревья🌲🌳🌴

1️⃣В бинарном дереве у каждой вершины может быть не более 2-х потомков. Получается: имеется одна корневая вершина; не более 2-х на втором «уровне»; не более 4-х на третьем; не более 8-ми на четвертом. Листьями будем считать как бы пятый уровень — их будет не более 16-ти. Если проследить логику, можно вывести общую формулу: максимальное число листьев для бинарного дерева глубины n равно 2^n.

2️⃣Из общих типов ансамблирования можно назвать бэггинг, стекинг, блендинг и бустинг (почитать про них подробнее можно, например, здесь). В этих терминах случайный лес — это бэггинг решающих деревьев, а градиентный бустинг — бустинг над решающими деревьями:)

3️⃣Технически сделать ансамбль из линейных моделей никто не запрещает, но комбинация линейных моделей будет той же самой линейной моделью — поэтому что-то более эффективное и качественное мы вряд ли получим. Деревья же являются нелинейными алгоритмами, поэтому ансамбли над ними помогают находить новые сложные зависимости.

4️⃣Первая «случайность» в случайном лесе — это случайная подвыборка, на которой обучается каждое дерево. А вторая — выбор наилучшего признака для каждого следующего разбиения в отдельном дереве также выбирается не из всех возможных, а из случайного набора меньшего размера (полный алгоритм можно посмотреть здесь в разделе «Алгоритм обучения классификатора»).

5️⃣XGBoost, LightGBM, CatBoost 🐈

6️⃣Деревья, в отличие от линейной регрессии, не умеют экстраполировать предсказания — то есть «продлевать» зависимость на значениях выборки вне тренировочной.

7️⃣Случайный лес — это усредненные предсказания отдельных независимых деревьев. Поэтому если убрать одно дерево, среднее тоже по идее должно поменяться. Но за счёт того, что деревьев в «лесе» обычно много, удаление одного почти не повлияет на качество.

8️⃣Бустинг тоже строится из отдельных деревьев, но они не являются независимыми, каждое следующее улучшает работу предыдущих. Поэтому если выбросить хотя бы одно дерево из этой системы, общее качество системы ухудшится.

Кстати, по данным аналитики hh август и раняя осень — лучшее время для поиска вакансий📊 Об этом чуть позже, а пока отдыхающим хорошего отпуска!🏖️

#карьера@data_easy
Telegram EasyData Привет, друзья! В прошлом посте, посвящённом задачам с собеседований, обсудили с вами метрики классификации. Как показывает практика, вторая по популярности тема - про деревья и ансамбли над ними🌳🌲🌴 Почему так? Во-первых, бустинги - самые эффективные алгоритмы…
  • 👍 10
  • ❤ 6
  • 🔥 5
More from @data_easy
  1. Sep 25, 2026Привет, друзья! Давайте разберём, как оценивать RAG-пайплайн. Тема довольно острая: наприм…
  2. Sep 20, 2026Привет, друзья! Adam и AdamW правят балом почти десять лет... Претенденты на замену были,…
  3. Aug 30, 2026Привет, друзья! Автор возвращается с каникул с полным мешком пирожков полезных материалов…
  4. Jul 12, 2026Привет, друзья! Представьте: у вас есть паркет на 10 гигов, и надо всего лишь посчитать по…
  5. Jun 28, 2026Привет, друзья! Устали от стандартных учебников по ML? Материалов с каждым месяцем и правд…
  6. Jun 21, 2026Привет, друзья! Сегодняшний рассказ про marimo - реактивный блокнот для Python, который мн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →