1️⃣ Как можно бороться с переобучением? Назови основные способы.
1) Для линейных моделей - L1 и L2.
2) Для деревьев - pre-/post-prunning.
3) Для knn - выбор кол-ва соседей, выбор функции расчёта расстояния.
4) Для всех моделей - различные уменьшения сложности модели, например через отбор признаков, уменьшение слоёв или нейронов в нейросетях / Data augmantation / Dropout / проведение кросс-валидации / Early stopping
2️⃣ Чем L1-регуляризация отличается от L2-регуляризации? В каких случаях их применять?
1) L1-регуляризация (Lasso) добавляет штраф пропорциональный абсолютным значениям весов модели. Может занулить веса у неинформативных признаков, потому применяется для их отбора.
2) L2-регуляризация (Ridge) добавляет штраф пропорциональный квадратам весов модели. Значимо уменьшает величину весов. Применяется, когда признаки коррелированы, и важно, чтобы модель учитывала их, но без сильного преувеличения их важности.
〰️〰️〰️〰️〰️〰️〰️〰️〰️〰️
Автор: Александр Дубейковский, специалист по ML, ex-Yandex
#собеседования_MLinside