С чего начать изучение Data science?
И от коллег, и просто знакомых частенько слышу такой запрос: я аналитик/дата инженер, но мне в работе нужно понимание основ Data Science, посоветуй материалы для изучения.
Действительно, сейчас умение строить модели - это не прихоть, а необходимость, даже если ваша работа напрямую не связана с ML. Все больше компаний требуют хотя бы базового понимания, какие методы машинного обучения существуют, и как их применить в своих рутинных задачах.
Если бы я сейчас с нуля начинала свое обучение, то впервую очередь я бы сделала упор на математике и на классических алгоритмах машинного обучения. Изучением нейросетей занимаемся строго после первых двух пунктов! Опустим тот факт, что надо уметь программировать на Python, думаю вы и так это понимаете.
Сделала вам подборку БЕСПЛАТНЫХ курсов и тем для изучения, которые помогут вам поэтапно во всем разобраться и выстроить в голове крепкую базу знаний.
🔵Начнем с математики, вот список конкретных тем, которые надо знать:
1. Линейная алгебра:
· Векторы, матрицы, операции над ними.
· Скалярное и векторное произведение.
· Определитель, ранг, обратная матрица.
· Системы линейных уравнений.
· Собственные векторы и собственные числа, разложение матриц.
2. Математический анализ:
· Функции, производные, градиент.
· Ключевая тема: Метод градиентного спуска — основа обучения большинства моделей ML.
· Частные производные (для функций многих переменных).
3. Теория вероятностей и статистика:
· Основные понятия: вероятность, условная вероятность, теорема Байеса.
· Распределения случайных величин (нормальное, биномиальное, Пуассона).
· Описательная статистика: среднее, медиана, дисперсия, стандартное отклонение.
· Статистическое оценивание: доверительные интервалы, проверка гипотез (t-тест, p-value).
Проходите без фанатизма, особенно «Теорию вероятности». Достаточно изучить темы, которые я расписала.
🔵Второй важный пункт в изучении дата саенс - это Exploratory Data Analysis (EDA). Я бы сказала, что этот пункт ключевой в обучении моделей, потому что если вы подадите плохие данные в самую крутую и мощную нейросеть, ничего путного из этого дела не выйдет. Если вы хорошо выполните предобработку данных, то для вашей задачи может хватить и простейшего алгоритма. Я бы предобработке посвятила отдельный пост, накидайте реакций с Обамой, если интересно.
Основные темы для изучения EDA.
1. Работа с данными на практике:
Pandas: Загрузка данных (CSV, Excel), исследование (head(), info(), describe()), фильтрация, группировка (groupby), обработка пропусков и выбросов.
Визуализация: Библиотеки Matplotlib и Seaborn. Построение hist, scatter plot, heatmap, box-plot.
2. Предобработка данных (Feature Engineering)
· Кодирование категориальных признаков (One-Hot Encoding, Label Encoding).
· Масштабирование и нормализация числовых признаков (StandardScaler, MinMaxScaler).
· Работа с пропусками (удаление, заполнение средним/медианой).
· Создание новых признаков.
=>
Post #146
2.25K