Привет, это Женя! В этом посте хочу кратко рассказать суть нашего доклада на Data Summit.
Тема нашей презентации – Building a Self-Service Data Platform With a Small Data Team. Она хорошо отражает суть выступления.
В Dodo Brands высокий спрос на аналитику со стороны бизнеса, причем от абсолютно разных доменов — от операционки до HR. А ещё у нас много партнеров-франчайзи, которым тоже нужен доступ к данным для принятия бизнес-решений.
У нас нет дата-департамента из 50 дата-инженеров — для нас это дорого. Так что мы уже несколько лет строим работу с данными по приниципу self-service: так, чтобы пользователи могли построить дата-пайплайн или дашборд либо с минимальным участием дата-инженеров, либо без него.
Для этого был создан проект job-generator. Он автоматически генерит PySpark-джобы и пайплайны на основе Jinja2-шаблонов. Всю boilerplate-логику вынесли в jinja-шаблоны. Пользователю остаётся выбрать верный шаблон и закоммитить пару конфигов в github. Из них джоба будет создана джоб-генератором и задеплена в Databricks. В реальности процесс чуть сложнее, но вкратце — так 🤓
Спустя 4 года могу сказать, что идея «взлетела»: в нашем Databricks сейчас крутятся больше 1700 джоб, и примерно 90% из них были созданы самими пользователями через config driven development и джоб-генератор. И только ~10% — это написанные «вручную» от начала до конца джобы. Вот так!
Post #1317
1.65K

- 🔥 18
- ❤ 9
- 👏 8
- 🤔 1
- 💩 1
- 🤡 1