1️⃣ Как можно найти выбросы в ваших данных?
Выбросы в данных можно находить с помощью статистических методов (например, Z-score или IQR для числовых фич), мультивариантных подходов (Mahalanobis distance, Isolation Forest, One-Class SVM), или через модели — например, анализ больших остатков после обучения простой модели или использование автоэнкодеров с высоким reconstruction error. Также помогают визуализации (PCA, t-SNE, boxplot) и, для временных рядов, STL-декомпозиция. Важно учитывать контекст: выброс — это не всегда ошибка, а порой ключевой сигнал (например, во фроде), поэтому детекция должна быть адаптивной и осмысленной, а не только механической.
2️⃣ Почему регуляризация не всегда спасает от переобучения? В каких случаях она может не работать?
Она может не работать, например, в следующих случаях:
1. Мало данных или плохое качество данных — при высокой шумности или малом количестве данных, модель переобучится даже с регуляризацией, так как будет запоминать шум.
2. Фичи в неправильном масштабе — если признаки не отнормированы, регуляризация работает неадекватно: признаки с большим масштабом будут штрафоваться больше.
3. Слабая регуляризация — если коэффициенты регуляризации слишком малы, эффект почти отсутствует.
4. Сильная мультиколлинеарность - L2 сгладит веса, но модель всё ещё может не научиться обобщать данные из-за линейных зависимостей. Стоит попробовать применить PCA.
3️⃣ Как измениться ROC-AUC, если все предсказания возвести в квадрат? Возведя в квадрат мы сильнее уменьшим уверенность модели на неуверенных скорах.
Возведение всех предсказаний в квадрат — это монотонно возрастающее преобразование, поэтому ROC-AUC не изменится, так как метрика зависит только от порядка (ранжирования) предсказаний. Даже если шкала уверенности изменится (например, низкие скоры станут ещё ниже), относительный порядок между позитивными и негативными примерами останется тем же. Следовательно, ROC-AUC остаётся инвариантной к таким преобразованиям.
#собеседования_MLinside