Доклад Дмитрия Березуцкого и Андрея Евтеева – это хардкорный рассказ про сложности обработки большого количества данных (150 Тб в сутки) и новые инструменты — dagster, arrow и polars, volcano.
⠀
Self-driving-разработчикам необходимо иметь возможность легко и оперативно получать обработанные данные с проездов беспилотных автомобилей для развития технологии и решения множества разнообразных повседневных задач: вычисления метрик проездов, определения качества доработок, получения датасетов для обучения моделей, построения HD-карты, разметки целевых ситуаций с проездов и пр.
⠀
Перед спикерами была поставлена задача разработать пайплайны обработки и автоматической разметки логов проездов беспилотных автомобилей и предоставить удобные инструменты для доступа к этим данным.
⠀
Из доклада вы узнаете:
⠀
- как они научились обрабатывать большой объем сериализованных данных с беспилотных автомобилей (130-150 Tb в сутки);
- какой Open Source-стек они для этого выбрали;
- почему отказались от Apache Airflow и остановились на Dagster;
- где и как они запускают вычисления на Spark, а где обходятся Apache Arrow и Polars;
- чем не устроил стандартный планировщик Kubernetes, и чем они его заменили (спойлер: Volcano);
- как они реализовали автоматическую эволюцию схем табличных данных в Spark + Hive Metastore.
⠀
Встречаемся уже совсем скоро на DevOpsConf 2024, ждём вас 🖐
⠀
✅ Программа конференции и билеты на сайте в описании канала
@DevOpsConfChannel