Инженерия данных - это всё ещё про написание кода или уже про настройку - а вот чего настраивать ? 😎
Недавно зарылся в финальную, 11-ю главу «Основ инженерии данных» Риса и Хоусли.
Авторы пытаются заглянуть за горизонт и понять, куда мы все катимся.
Что там пишут? 🤯 - издание от 2022 года если что 🤖
• Инструменты упрощаются.
• Эпоха, когда нужно было быть «хакером инфраструктуры», чтобы просто заставить данные течь из пункта А в пункт Б, уходит.
• Наступает эра Cloud Data OS, где всё работает из коробки, а фокус смещается с как это поднять на как это приносит пользу бизнесу(FinOps).
• Стриминг вытеснет батчи.
+ Ещё пророчат окончательное слияние инженерии данных с разработкой приложений и ML.
То есть инженер данных будущего - это не просто парень - ETL-пайплайн, а полноценный архитектор систем, где данные и логика неразрывны.
В целом то мы никогда не были "Просто парнем с ETL" 👀
В чем авторы оказались чертовски правы? 🔤
Прошло почти 4 года с момента выхода оригинала, и вот что из предсказаний стало нашей реальностью:
• Инструменты для людей (User-Friendly Infrastructure): Посмотрите на расцвет стека вокруг dbt, Airbyte или managed-решений в облаках. Настройка базового пайплайна теперь занимает часы, а не недели. Порог входа в железо действительно упал.
• Инженер данных <-> Backend-разработчик: Грань стирается. Мы всё чаще пишем на Python/Go, используем CI/CD, тесты и программные паттерны. Больше нет просто SQL-парней, есть разработчики платформ данных.
• Real-time - это база: Если в 2022-м потоковая обработка была космосом для избранных, то сегодня бизнес требует отчеты здесь и сейчас. Kafka, ClickHouse и стриминг стали стандартом де-факто для живых систем.
• Фокус на FinOps: Как и предсказывали авторы, умение не просто поднять кластер, а сделать это эффективно и не раздеть компанию на счетах от AWS/GCP - это теперь чуть ли не ключевой скилл сеньора.
Мой взгляд на джунгли данных сегодня:
1. Бизнес-эффект- это фильтр №1. Построить эффективную платформу, где ясно, как данные превращаются в решения - это база.
Если нет понимания бизнес-эффекта от датасета, мы такое в работу... ну, в идеале не берем (хотя, признаюсь, грешим иногда, берем 😄). Но стратегически - DE без понимания бизнеса больше не живет.
2. Стриминг перестал быть болью. Технологии типа Pub/Sub - это теперь супер-удобно. Легко поднимается, масштабируется, а мониторинг не превращается в ночной кошмар.
3. Грани между DE и Backend никогда и не было. Для меня всегда было нормой: сам разработал сервис, сам поднял, сам встроил в архитектуру и сам поддерживаешь. Будь то кастомный код или Open Source вроде Airflow и Superset. Ты - инженер в широком смысле, а не просто перекладыватель json-ов.
4. ML - это просто часть пайплайна. Имплементация моделей в логику, настройка входов/выходов и дообучение — это задачи, которые DE-специалисту(мне) приходится решать постоянно.
5. FinOps - бесконечная история. Облака и их стоимость - это отдельное искусство, которое я сам продолжаю осваивать. Это критически важный навык: сделать не просто работающее решение, а экономически оправданное.
Какое будущее? 🔮
Мой вывод: скоро формула будет выглядеть так: 1 Data-спец + LLM.
Один человек с помощью ИИ сможет закрыть весь цикл:
✅ Глубокий анализ.
✅ Создание ML-модели.
✅ Написание бэкенда.
✅ Деплой и настройка CI/CD.
В итоге мы получаем не просто инженера данных, а Full-stack Data Product Engineer - человека, который в одиночку выдает готовый продукт, полностью закрывающий потребность бизнеса.
Согласны с таким прогнозом или DE останется узкой нишей? Пишите в комментариях! 👇
#data_engineering #future #books #DataJungle
Post #111
308
- 🔥 3