👉 Переходим от теории к практике и показываем, из каких компонентов собирается Data Lakehouse.
Платформу данных с архитектурой Data Lakehouse можно собрать на базе VK Data Platform. Данные хранятся в формате Parquet в VK Object Storage с S3-совместимым API, а табличный слой работает на Apache Iceberg. Для обработки можно подключать разные вычислительные движки в зависимости от задачи.
🎛 Согласованный доступ движков к таблицам обеспечивает собственный Iceberg REST-каталог на базе доработанного Lakekeeper. Он также централизованно управляет правами вплоть до данных в S3. Политики действуют сквозным образом, поэтому их нельзя обойти через другой движок или прямое обращение к хранилищу.
Такой подход помогает собрать один контур данных для BI, аналитики и ML, не размножая лишние копии и не завязывая все сценарии на одну систему.
📃 Как выбрать технический каталог для Lakehouse, разобрали отдельно: сравнили девять решений по 14 критериям. Подробности — по ссылке →
📬 Мы в MAX
Post #541
300

- ❤ 4
- 👍 4
- 🔥 4