⛈ Дамы и господа, всем доброго вечера!
За последние несколько дней я сделал невероятное (для себя):
— Изучил различные подходы к трансформации данных в Kafka: SMT / ksql / kstreams / flink / spark streaming / apache beam / Faust
— Собрал Devcontainer для Java 21 + Maven
— Изучил десятки примеров кода создания SMT + Unit tests
— Научился работать с Maven: properties, dependencies, build
— Создал код для собственных Single Message Transformations + Unit tests
— Собрал JAR-файлы и отправлял их в Kafka Connect docker image
— Потратил уйму часов на Debug, изучение логов, поиск ошибок и исправления на реальных данных в Kafka Connect cluster
— И в конечном счете достиг искомого результата ✅
🐹 В процессе я прибегал к помощи Copilot, и это классный опыт! Заслуживает отдельного обзора.
В итоге, вырисовывается такая картинка общим планом:
— Все БД-источники данных подключены через CDC (Kafka + Debezium)
— Near real time sync (отставание до 1 минуты)
— PII чистится на лету, никогда не попадая в Snowflake 🫢
— 97% cost saved (20% overall spend) в сравнении с предыдущим EL tool (Hevo)
— Это смешно, но Snowpipe streaming 24 / 7 стоит копейки (10$ в неделю 🤯)
— Открываются невероятные возможности создания онлайн-приложений: fraud, scoring, marketplace, reporting
❤ Как только я успею к дедлайну и закончу основую разработку, я примусь за обещанные публикации, обзоры, мнения.
🌐 @data_apps | Навигация по каналу
Post #400
1.74K
- 🔥 32
- ❤ 7
- 👍 4
- 😱 4