Раньше дата инженер просто перекладывал данные из одной папки в другую. Сейчас этого стало мало…
Раньше от нас ждали только работающие пайплайны. В 2026 году нужно понимать, как устроена вся платформа целиком 📚Где данные лежат, как они меняются и почему бизнес может им доверять. Специалист теперь должен быть более универсальным
Сейчас рынок требует понимания инструментов, которые актуальны и могут навести порядок в данных🌪
Собрал подборку, что надо знать, чтобы быть в тренде:
⏺Lakehouse и Apache Iceberg: С увеличением количества данных и требованиям к их консистентности такой вид хранилища становится все более предпочтительным.
⏺Trino: универсальный движок для подключения к разным бд.
⏺dbt: необходим, чтобы логика трансформаций была прозрачной и с тестами, а не превращалась в черный ящик.
⏺OpenMetadata: необходим, чтобы через месяц не гадать, откуда пришла эта таблица и кто её наполнил.
⏺Kubernetes: платформа на которой сейчас крутится почти всё - от Airflow до Spark.
Важный момент: Успешно растет тот, кто умеет собрать систему, которая не падает каждые пять минут и понятна всей команде ☝
Если хотите разобраться, какие именно инструменты учить на вашем уровне, чтобы не тратить время впустую: загляните в мой роудмап 📍. Там я подробно расписал стек под каждый грейд: от стажера до сеньора.
❗️Забирайте роудмап здесь: ЧИТАТЬ
Кстати, какой инструмент из списка вы уже используете, а какой кажется переоцененным? Пишите в комментариях, обсудим
Post #100
1.41K

- 🔥 10
- 👍 4
- 💯 3