🖥 Data Lake появился так: сырые данные, логи и историю стали складывать в более дешевое хранилище, а обрабатывали их отдельными вычислительными движками по мере необходимости.
Data Lake помог разгрузить DWH, но без табличного слоя озеро быстро рисковало превратиться в болото: данные лежат, но не всегда ясно, какая версия актуальна, кто что изменил и можно ли на этом стабильно строить BI и ML.
В итоге вместо одного контура компании получали два, а еще — новые копии данных, новые пайплайны и риск превратить озеро в болото файлов, на котором сложно построить BI и ML.
Ответом стала архитектура Data Lakehouse. Хранение больших объемов данных оставалось в объектном хранилище, а поверх файлов формировался управляемый табличный слой — с метаданными, версиями таблиц, транзакциями и согласованным доступом для разных движков.
Так слой данных превратился из архива в полноценный рабочий контур: для SQL-аналитики, ETL/ELT, BI-витрин, ad-hoc-запросов и подготовки данных для ML/AI.
Хотите узнать, как это работает на практике?
Если да, проверьте себя, пройдя опрос ⬇️
📬 Мы в Max
Post #529
490

- ❤ 5
- 👍 3
- 🔥 3