Запись доклада Дмитрия Березуцкого и Андрея Евтеева «Построение горизонтально масштабируемой системы обработки данных с беспилотного транспортного средства» с DevOpsConf 2024
Это хардкорный рассказ про сложности обработки большого количества данных (150 Тб в сутки) и новые инструменты — dagster, arrow и polars, volcano.
В докладе спикеры рассказали:
- как они научились обрабатывать большой объем сериализованных данных с беспилотных автомобилей (130-150 Tb в сутки);
- какой Open Source-стек для этого выбрали;
- почему отказались от Apache Airflow и остановились на Dagster;
- где и как запускают вычисления на Spark, а где обходятся Apache Arrow и Polars;
- чем их не устроил стандартный планировщик Kubernetes, и чем они его заменили (спойлер: Volcano);
- как реализовали автоматическую эволюцию схем табличных данных в Spark + Hive Metastore.
▶️Запись доклада в VK Видео
Посмотрите сами и поделитесь с коллегами 🙌
#записьдокладаDevOpsConf
@DevOpsConfChannel
Post #1245
1.05K

- ❤ 2
- 👍 2
- 👎 1
- 🔥 1
- 👏 1