Представьте: стриминг пишет в Avro, отдел машинного обучения — в Parquet, аналитики — в ORC. Пока вы работаете с гигабайтами данных — терпимо. Но на терабайтах ETL-конвейеры превращаются в цифровой ад с медленными запросами, дорогим хранением и тремя версиями одной и той же бизнес-сущности.
Что будете делать, чтобы исправить?
❤️ — добавлю еще одно хранилище и кэширование для ускорения запросов
🔥 — унифицирую форматы и перепишу ETL-конвейеры
🌚 — внедрю табличный формат Iceberg как единый табличный слой над данными в объектном хранилище
Post #6869
1.4K
- 🔥 7
- ❤ 6
- 🌚 5