Стоимость data stack растёт на границах между его компонентами
Когда загрузка, хранение, обработка и визуализация реализованы в отдельных системах, data-команда поддерживает не только сами инструменты, но и обмен между ними. Изменение источника, схемы данных или способа расчета затрагивает сразу несколько интеграций.
DataLens Platform объединяет основные этапы работы с данными. В основе находится lakehouse на S3 и Apache Iceberg. Trino отвечает за интерактивные запросы, Spark — за ресурсоемкие преобразования, Airflow — за оркестрацию процессов.
На уровне всей платформы работают каталог метаданных и общая модель доступа. Хранение и вычисления масштабируются отдельно.
ИИ-помощник становится еще одним способом использовать подготовленные данные: он помогает исследовать их, формировать SQL-запросы и строить визуализации.
Post #6128
2.85K
- ⚡ 7
- 🙈 6
- 🌚 5
- ❤🔥 3
- 🍌 3
- 🙉 2
- 🐳 1