✍🏻5 советов Data Scientist’у по Scikit-learn
1. Заполнение пропусков с помощью итеративного заполнителя – IterativeImputer, который итеративно ищет и заполняет пропущенные значения, улучшая датасет с каждой итерацией. Для использования этой функции ее следует импортировать enable_iterative_imputer из пакета sklearn.experimental
2. Генерация случайных фиктивных данных, чтобы зарезервировать место, где должны присутствовать реальные или полезные данные. Фиктивные данные нужны для тестирования, поэтому они должны быть надежными. Для этого можно применить функции make_classification() в задаче классификации или make_regression() в задаче регрессии. Также можно установить количество образцов и фичей, чтобы контролировать поведение данных в отладке и тестировании.
3. Сохранение ML-моделей, чтобы повторно использовать их без переобучения. Чтобы сериализовать свои алгоритмы и сохранить их, пригодятся Python-библиотеки pickle и joblib.
4. Построение матрицы ошибок с помощью функции plot_confusion_matrix, которая отображает истинно положительные, ложноположительные, ложноотрицательные и истинно отрицательные значения.
5. Визуализация деревьев решений с помощью функции tree.plot_tree в пакете matplotlib без ручной установки зависимостей для создания простых визуализаций. Также можно сохранить дерево как графический png-файл.
https://www.educative.io/blog/scikit-learn-tricks-tips
Post #122
415