Ответы на вопросы:
1️⃣ Что вы чаще всего использовали для проверки качества моделей из Scikit-Learn?
Чаще всего в Scikit-Learn для оценки качества моделей используют:
- cross_val_score — кросс-валидация с метриками (accuracy, F1, R² и др.)
- train_test_split — разделение на тренировочную и тестовую выборки для простой оценки
- Метрики из модуля metrics (accuracy_score, precision, recall, roc_auc, mean_squared_error и др.) для измерения качества на тесте
2️⃣ Какие бывают усреднения метрик?
Основные виды усреднения метрик (особенно для многоклассовых задач):
- micro — считает метрику по всем объектам сразу (агрегирует TP, FP, FN), подходит при несбалансированных классах.
- macro — усредняет метрики по классам одинаково, без учёта их размера, подчеркивает производительность на редких классах.
- weighted — усредняет по классам с весами, пропорциональными количеству объектов в каждом классе, баланс между micro и macro.
3️⃣ Bag of words – плюсы и минусы использования?
Bag of Words (BoW):
- Плюсы: простая, быстрая, интерпретируемая. Хорошо работает на коротких текстах.
- Минусы: игнорирует важность слов и контекст. Зависит от частоты, может переоценивать часто встречающиеся, но малоинформативные слова. Высокая размерность и разреженность
#собеседования_Mlinside