TGViewer
tl;dr data tl;dr data @tldr_data · 153 subscribers
Post #60 79
LAKEHOUSE LANDSCAPE 2026

Почти год назад обсуждение Lakehouse всё ещё было сосредоточено вокруг открытых табличных форматов и предположения, что Parquet с метаданными достаточно для большинства корпоративных задач. Но управление данными быстро развивается, и ландшафт 2026 года показывает более зрелую, модульную и амбициозную экосистему.

Что изменилось?

✅ Файловый слой снова становится зоной инноваций.
Новые форматы, такие как Lance и Vortex, привлекают внимание, потому что ориентированы на сценарии, для которых классические Parquet-ориентированные подходы не предназначались: мультимодальный ИИ, векторный поиск, произвольный доступ, встроенные индексы и выборочные чтения. В то же время File Format API в Apache Iceberg - это серьёзный шаг вперёд: он позволяет подключать новые форматы файлов без нарушения open lakehouse-контракта.

✅ Каталоги становятся стабильнее и более стандартизированными.
Ключевой сдвиг- не в появлении множества новых каталогов, а в росте значимости Iceberg REST Catalog как общего слоя интероперабельности. Именно он сохраняет экосистему открытой, позволяя движкам, инструментам и managed-сервисам взаимодействовать через единый протокол, а не через хрупкие интеграции.

✅ Открытая интероперабельность явно побеждает.
Провайдеры и платформы всё больше сходятся вокруг совместимых с Iceberg паттернов доступа, REST-подключения к каталогам и подходов с выдачей учётных данных (credential vending). Центр тяжести смещается от изолированных метаданных к единой control plane, которая может последовательно обслуживать разные движки.

✅ Появляются лёгкие инструменты, упрощающие работу с Lakehouse.
DuckDB становится одним из самых практичных движков доступа к современным lakehouse, с растущей поддержкой Iceberg, Lance и каталогов. DataFusion также набирает популярность как переиспользуемый execution-слой на базе Apache Arrow, делая доступ к lakehouse более программируемым и удобным для встраивания в современные системы.

✅ Streaming-first подход становится частью архитектуры lakehouse.
Apache Paimon заслуживает большего внимания, поскольку предлагает модель, ориентированную на стриминг, для обработки высокочастотных обновлений и CDC-нагрузок. Это важно, потому что корректность в реальном времени и непрерывное обслуживание таблиц становятся базовыми требованиями, а не опциональными возможностями.

Главный вывод:
lakehouse больше не сводится к связке Parquet + table format. Архитектура становится многослойной. Файловый слой, каталоги, execution и streaming развиваются независимо. За счёт этого систему можно менять частями — без миграций на годы вперёд.

@tldr_data
  • 👍 4
More from @tldr_data
  1. Sep 18, 2026SLayer Спросите агента о выручке дважды — и он дважды напишет два никак не связанных между…
  2. Sep 13, 2026OpenAI запустила Data agent в ChatGPT Work — агента для работы с корпоративными данными. О…
  3. Sep 12, 2026LLMSQLQueryOperator В Airflow появился новый декоратор task.llm_sql, который генерирует SQ…
  4. Sep 11, 2026walshadow walshadow реплицирует данные из PostgreSQL в ClickHouse из физического WAL, вклю…
  5. Sep 9, 2026HydraDB - fast graph database on object storage HydraDB превращает графовую базу данных в…
  6. Sep 8, 2026Make analytics context usable by agents ktx — open-source context layer for data agents, к…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →