Reddit Data Tech Stack
Reddit рассказал, как устроена его data platform.
Масштаб впечатляет: более 120 млн DAU, миллиарды комментариев и кластер из 500+ Kafka brokers, обрабатывающий десятки миллионов сообщений в секунду.
Архитектура при этом достаточно прямолинейная. Kafka используется как центральная event bus. Оттуда события попадают в Flink (внутренний проект Snooron) для потоковой обработки и применения content safety rules в реальном времени, а также в Spark, который отвечает за batch-пайплайны и подготовку данных для Druid.
Изменения в операционных базах захватываются через Debezium и публикуются в Kafka.
Оркестрацией занимается Airflow, сырые данные хранятся в S3, а аналитическое хранилище — BigQuery, куда Reddit ранее мигрировал с Redshift.
Интересен и подход к облакам.
Основная инфраструктура работает в AWS, а GCP появился благодаря коммерческому партнерству с Google. Вместе с ним в стек вошли BigQuery и Vertex AI.
Для Data Engineer здесь, пожалуй, нет ничего революционного.
Скорее это возможность посмотреть на реальную архитектуру, которая работает под очень высокой нагрузкой.
Kafka → Flink/Spark → Druid/BigQuery с Debezium для CDC — стек, который масштабируется и при этом остается достаточно понятным с точки зрения разделения ответственности между компонентами.
#datainfrastructure
@tldr_data
Post #146
152

- 👍 2
- ❤ 1