Как изучать анализ данных с нуля? (чтобы пройти собеседования на начинающего аналитика)
По многочисленным просьбам собрал все материалы, по которым, я считаю, можно подготвить аналитику и анализ данных с нуля за достаточно небольшое время (при этом можно будет подаваться и пробовать себя на собеседованиях).
Технические навыки:
- Питон - будем считать, что именно он используется для DS и без него никак. Важно понимать не просто базовый синтаксис, но и встроенные структуры данных: словари, кортежи, множества. С нуля можно пройти курс на питонтьюторе (его я всем ученикам советовал в том числе) и этого будет вполне достаточно, к тому же там есть задачки, которые могут дать в качестве одного из заданий на собеседованиях. 🐍
- SQL - язык запросов к базам данных. Так уж вышло, что аналитику нужно уметь получить данные из таблиц в нужном виде, чтобы затем их изучать. Именно для этой цели и используется SQL. Для роли аналитика достаточно изучить всё, что связано с получением данных (т.е. запросы вида SELECT). Для начала можно пройти курс на степике, а затем порешать задачи на sql-ex - там приведены многие шаблоны задач, которые могут спросить при отборе на позицию аналитика. 👨💻
- библиотеки pandas, numpy, matplotlib и seaborn для питона.
Pandas помогает удобно работать с табличными данными и достаточно сильно похож логикой на SQL. Изучить теорию, наверное, можно и на ютубе (вот пример), после чего рекомендую взять какой-нибудь датасет и вручную “покрутить” его в Jupyter Notebook’е (юпитер - это удобная среда для последовательного выполнения кода, подробнее например тут). Основные операции в pandas стоит знать наизусть (чтение таблиц, редактирование, работа с пропусками, изменение типов данных)
Numpy помогает быстро и удобно производить математические операции. К тому же он используется во многих других библиотеках. Можно глянуть какой-нибудь туториал на ютубе. Например, вот тут. Знать все операции наизусть необязательно, главное уметь быстро в них сориентироваться при необходимости.
Matplotlib и Seaborn - библиотеки для визуализации данных. Тут скорее важно научиться понимать, какие именно графики можно построить по тем или иным имеющимся данным. Знать все функции и методы наизусть - необязательно. Можно почитать вот эту большую статью с примерами графиков, чтобы потом иметь возможность построить что-то подобное для своих данных. Seaborn, возможно, знать и необязательно, но точно будет плюсом (там графики чуть красивее получаются…)
Также объемные вебинары по этим библиотекам есть на сайте в виде лекций №7-10.
Лично я эти 4 библиотеки изучил в процессе прохождения курса Яндекс.Практикума “Специалист по Data Science”. Если вы уже хорошо знаете теорию и математику, то на этом курсе можно неплохо нарешать практические задания на датасетах (могу, кстати, дать промик на скидку 7%, если вы хотели взять курс). Впрочем, эти библиотеки можно спокойно изучить и без курса, главное не полениться и применить их на парочке датасетов. 🧑💻
- алгоритмы и структуры данных - по желанию, но ведущие компании (Тинькофф, Яндекс и т.п.) вас всё равно спросят про базовые алгоритмы и структуры данных. Аналитикам, в отличие от разработчиков, должно вполне хватить курса тренировок по алгоритмам от Яндекса: там представлены лекции с теорией, домашки, а также разборы к ним (я учился на второй версии этого курса, но недавно вышла версия 3.0). После этого перед собеседованиями можно порешать задачки с LeetCode уровня Easy и Medium. Этого будет очень даже достаточно 👍
Post #44
8.14K
- 👍 34
- ❤ 18
- 🔥 7
- 💘 4
- 💯 3
- 🦄 2
- 👌 1
- 🍓 1