Какие технологии Big Data стоит изучать в 2025 году?
Новый год уже наступил, какие же технологии изучать, чтобы оставаться востребованным специалистом и модным-молодежным? Давайте же разберемся!
Основная тройка для Big Data остается также неизменной:
⚡️ Apache Spark
Spark остается одним из главных инструментов для распределенной обработки данных. Конечно, появляются и другие фреймворки для похожих задач, но Spark уже проверен временем, поддерживается и регулярно дорабатывается такими крупными компаниями, как Databricks и Snowflake, так что в ближайшее время он никуда не уйдет.
🐘 Hadoop
Хотя я и слышал мнение, что Hadoop "умирает", он продолжает использоваться практически во всех крупных компаниях в различных сборках, и ему трудно предложить замену благодаря его надежности и стабильности, в обозримой перспективе вряд ли его что-то заменит.
💠Apache Airflow
Airflow является основным инструментом для оркестрации процессов, отслеживания их выполнения, он активно развивается, и в него активно добавляются новые фичи, так что он скорее всего так и останется самым популярным решением благодаря своей простоте, нативности и удобству.
А теперь перейдем к технологиям поновее. Начнем с двух СУБД, которые на данный момент чаще всего встречаются на российском рынке: Greenplum и Clickhouse.
🔎 ClickHouse
Стал популярным благодаря открытости кода и скорости своей работы. Он активно развивается нашими друзьями из Яндекса, сообщество очень живое и сам Clickhouse активно внедряется и используется во многих компаниях.
🍃 Greenplum
Также стал популярным благодаря открытости кода, но в этот раз был подхвачен ребятами из Arenadata и Т-Банка. Greenplum является распределенной СУБД, которая может хранить и обрабатывать огромные объемы данных, работает стабильно, и сейчас кластер Greenplum стоит в любом банке.
🌐 Trino
Довольно новый инструмент, который начали внедрять компании, решившие сделать у себя Data Lakehouse. Trino позволяет обрабатывать данные из различных источников, включая S3, HDFS и базы данных, не перенося их в единое хранилище, и делает это очень быстро.
💾 S3 и объектные хранилища
Хотя Amazon и ушел из России, S3 и облачные решения остаются стандартом для хранения больших объемов данных благодаря своей надежности, низкой стоимости и интеграции с инструментами Big Data, и сейчас S3 предоставляют такие компании, как Яндекс, ВК, Cбер. В сочетании с такими технологиями, как Trino, S3 становится одним из решений для замены Hadoop.
Кроме того, облачные решения часто используют небольшие компании, поскольку это является более дешевым и оптимизированным решением, чем покупать себе сервера и ставить все самим.
Это лишь часть всего того, что может использовать Data Engineer, и я буду продолжать рассказывать вам об этом зоопарке в следующих постах, а пока ставьте огонечки и делитесь вашим мнением в комментариях😎
@bigdata_postupashki
Post #3
4.97K
- 😍 6
- 👍 2
- 🔥 1