Такая схема хорошо работала для регламентной отчетности. Но объем и разнообразие данных росли: в хранилище начали складывать сырые события, логи, многолетнюю историю, датасеты для ML.
DWH становился все менее удобным для таких сценариев, потому что:
🔵хранение дорожало
🔵расширять кластер становилось сложнее
🔵тяжелые расчеты и разовые запросы аналитиков конкурировали с отчетностью за ресурсы
🔵под каждый новый сценарий приходилось готовить данные и дорабатывать пайплайны.
Поэтому появился другой подход: не переносить все в дорогой DWH, а построить рядом Data Lake — озеро данных. Но и его на все не хватило.
🔥 — если будете ждать подробностей
📬 Мы в МАХ
