Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏 — https://t.me/bdscience — Big Data Science channel (english version)
💼 — https://t.me/bds_job — channel about Data Science jobs and career
Post #122
415
✍🏻5 советов Data Scientist’у по Scikit-learn
1. Заполнение пропусков с помощью итеративного заполнителя – IterativeImputer, который итеративно ищет и заполняет пропущенные значения, улучшая датасет с каждой итерацией. Для использования этой функции ее следует импортировать enable_iterative_imputer из пакета sklearn.experimental
2. Генерация случайных фиктивных данных, чтобы зарезервировать место, где должны присутствовать реальные или полезные данные. Фиктивные данные нужны для тестирования, поэтому они должны быть надежными. Для этого можно применить функции make_classification() в задаче классификации или make_regression() в задаче регрессии. Также можно установить количество образцов и фичей, чтобы контролировать поведение данных в отладке и тестировании.
3. Сохранение ML-моделей, чтобы повторно использовать их без переобучения. Чтобы сериализовать свои алгоритмы и сохранить их, пригодятся Python-библиотеки pickle и joblib.
4. Построение матрицы ошибок с помощью функции plot_confusion_matrix, которая отображает истинно положительные, ложноположительные, ложноотрицательные и истинно отрицательные значения.
5. Визуализация деревьев решений с помощью функции tree.plot_tree в пакете matplotlib без ручной установки зависимостей для создания простых визуализаций. Также можно сохранить дерево как графический png-файл.
https://www.educative.io/blog/scikit-learn-tricks-tips
Educative: Interactive Courses for Software Developers Data Science Made Simple: 5 essential Scikit-learn tricks Scikit-learn is the most popular Python machine learning library for data science. Learn the top tips and tricks to take your Scikit skills to the next level. 1. Заполнение пропусков с помощью итеративного заполнителя – IterativeImputer, который итеративно ищет и заполняет пропущенные значения, улучшая датасет с каждой итерацией. Для использования этой функции ее следует импортировать enable_iterative_imputer из пакета sklearn.experimental
2. Генерация случайных фиктивных данных, чтобы зарезервировать место, где должны присутствовать реальные или полезные данные. Фиктивные данные нужны для тестирования, поэтому они должны быть надежными. Для этого можно применить функции make_classification() в задаче классификации или make_regression() в задаче регрессии. Также можно установить количество образцов и фичей, чтобы контролировать поведение данных в отладке и тестировании.
3. Сохранение ML-моделей, чтобы повторно использовать их без переобучения. Чтобы сериализовать свои алгоритмы и сохранить их, пригодятся Python-библиотеки pickle и joblib.
4. Построение матрицы ошибок с помощью функции plot_confusion_matrix, которая отображает истинно положительные, ложноположительные, ложноотрицательные и истинно отрицательные значения.
5. Визуализация деревьев решений с помощью функции tree.plot_tree в пакете matplotlib без ручной установки зависимостей для создания простых визуализаций. Также можно сохранить дерево как графический png-файл.
https://www.educative.io/blog/scikit-learn-tricks-tips




