👩🏫Как выбирать между разными метриками нечистоты (impurity metrics) при построении деревьев решений
Популярные варианты: Gini impurity и энтропия (information gain).
Сравнение:
🧬 Gini impurity быстрее вычисляется и часто даёт похожие разбиения, но иногда слегка предпочитает разделения, изолирующие наиболее частый класс.
🧬 Entropy / Information gain отражает уменьшение неопределённости после разбиения, теоретически более «информативна», но вычисляется медленнее.
Выбор на практике: часто метрики дают схожие результаты, поэтому решение зависит от скорости обучения, размеров данных и поведения конкретного датасета. Экспериментальная проверка с кросс-валидацией может помочь определить лучший вариант для вашей задачи.
🐸 Библиотека собеса по Data Science
Post #1234
778
- 👍 3