Александр Толмачев начал путь в Data Science около 14 лет назад — в период, когда профессия в России только формировалась. Тогда еще не было четкого разделения на аналитику данных, инженерию данных и ML-инженерию.
На заре развития профессии дата-сайентист был универсальным специалистом. Он сам писал ETL, переносил данные из одной системы в другую, собирал витрины, работал с SQL, настраивал эксперименты, строил дашборды, обучал модели и объяснял результаты бизнесу.
«Это был такой некий универсальный зверь. На первых конференциях мы рисовали такого золотого единорога», — описывает Александр.
Эта универсальность подразумевала широкий кругозор: специалист должен был понимать и техническую сторону задачи, и экономическую. Но с ростом индустрии стало понятно, что один человек не может одинаково хорошо закрывать все направления.
Сначала выделились продуктовая, маркетинговая и риск-аналитика — специалисты, которые работают с A/B-тестами, гипотезами, метриками и бизнес-доменом. Затем отдельной профессией стала инженерия данных: инфраструктура, пайплайны и хранилища усложнились — и эту часть работы тоже пришлось выносить в самостоятельное направление.
Сегодня, по словам Александра, «как такового дата-сайентиста особо-то и нет — это в целом направление, которое разошлось на разные фокусы». Часть, связанную с машинным обучением, теперь чаще называют ML Engineering, а внутри каждого направления появляются еще более узкие специализации: DataOps, MLOps, продуктовая, финансовая, антифрод- и логистическая аналитика.
Александр выделяет 3 основных трека в Data Science:
1️⃣ Data Analyst — для тех, кому ближе бизнес-мышление: метрики, гипотезы, A/B-тесты, дашборды и исследования. Такой специалист помогает бизнесу находить инсайты в данных и принимать решения.
2️⃣ Data Engineer — для тех, кому нравится программировать данные: стр оить ETL-пайплайны, хранилища и витрины, работать с Airflow, Spark, Kafka и SQL. Это фундамент для работы аналитиков и ML-специалистов.
3️⃣ ML Engineer — для тех, кому ближе математика, модели, алгоритмы и доведение ML до продакшена. Здесь уже недостаточно просто выбрать CatBoost, LightGBM или другую модель. Важно, чтобы она запускалась, стабильно работала и помогала бизнесу.
«Важно даже не то, какая модель у тебя выбрана, а то, что специалист дотаскивает модель до продакшена», — подчеркивает Александр.
Стать экспертом сразу во всех 3 направлениях почти невозможно: в каждом треке накопилось слишком много навыков, паттернов и профессиональных нюансов.
Поэтому Александр советует выбирать не по уровню престижа или зарплаты:
«То, что у вас внутри больше откликается, — именно туда нужно идти. Определитесь, что вы страстно любите. Это самое главное, это фундамент всей жизни».
В программе онлайн-магистратуры «Науки о данных» фундаментальная база сочетается с профильными треками: Machine Learning, Data Engineering и Data Analysis. Обучение помогает не просто идти в Data Science «вообще», а выстраивать понятную профессиональную траекторию.
Подробнее о программе и треках — на сайте https://mipt.online/masters/data_science. Прием документов открыт.
