TGViewer
Data Driven культура от AW BI Data Driven культура от AW BI @awbi_ru · 1.73K subscribers
Post #367 327
Iceberg: почему это слово вдруг появилось в каждой второй вакансии дата-инженера📊

Ещё пару лет назад Iceberg мог фигурировать в резюме разве что инженера Netflix. Сегодня Iceberg встречается в вакансиях BI-разработчиков и дата-инженеров, а аналитикам всё чаще пишут «будет плюсом». Разбираемся, что это за формат, откуда хайп и почему это интересно нам самим как команде BI-продукта.

🤔Давайте разбираться, кто такой это ваш…
Apache Iceberg - это открытый формат таблиц для больших аналитических данных. 
Если классический дата-лейка - это по сути просто набор файлов. И чтобы работать с ними, нужно знать, как эти самые файлы разложены по папкам, а любое изменение схемы или обновление данных часто требует переписывать большие объёмы информации.

То Iceberg решает этот вопрос, добавляя поверх файлов слой метаданных. Благодаря ему система знает, где лежат данные, как они связаны между собой и как менялась таблица со временем.

В результате дата-лейк начинает вести себя как полноценная SQL-таблица: поддерживает ACID-транзакции, позволяет менять схему без пересборки данных, автоматически управляет партиционированием и хранит историю изменений, к которой можно вернуться в любой момент.

⚡️Откуда взялся этот ваш…
Как и многие технологии для больших данных, Iceberg родился из очень практической проблемы.

В 2017 году в Netflix поняли, что Apache Hive больше не справляется с объёмами хранилища свыше 100 ПБ: изменение схемы обходилось слишком дорого, а полноценной поддержки транзакций не было. Тогда инженеры Ryan Blue и Dan Weeks разработали Iceberg, который позволял работать с огромными таблицами без этих ограничений.

Через год Netflix передала проект Apache Software Foundation. Сегодня это уже не технология Netflix, а один из главных открытых стандартов для аналитических хранилищ.

📌Почему шум поднялся именно сейчас
Несколько лет Iceberg оставался инструментом в основном для крупных компаний вроде Netflix и Airbnb. Но за последние пару лет ситуация изменилась: практически все крупные аналитические платформы добавили его полноценную поддержку. 

Раньше данные, загруженные в одну систему, были фактически привязаны к ней. Переход на другую платформу часто означал долгую и дорогую миграцию с переписыванием всего хранилища. Iceberg меняет эту модель. Данные хранятся один раз в открытом формате, а работать с ними могут разные движки. 

Этот сценарий актуален прежде всего для компаний масштаба Netflix или Airbnb: петабайтные хранилища, множество разных вычислительных движков поверх одних и тех же данных. Именно там независимость от вендора становится критичной. Отсюда и требование в вакансиях: работодателям важно, чтобы человек понимал сам принцип устройства современного хранилища, а не был экспертом только в интерфейсе одного продукта.

👀Как мы смотрим на это в AW BI
Для нас это прежде всего маркер зрелости рынка. Логика Iceberg (метаданные отдельно от файлов, версионирование, эволюция схемы без даунтайма) в том или ином виде встречается почти в любой современной аналитической платформе. Поэтому, если специалист понимает архитектуру Iceberg, ему проще разобраться в устройстве любой BI-системы: принципы там пересекаются.

🙂Мы тоже двигаемся в сторону файловых хранилищ: в ближайших планах на 2026 год - коннектор к Data Lake через HDFS, который расширит работу AW BI с файловыми источниками данных. Поддержку конкретно табличного формата Iceberg пока не анонсируем, но архитектурная логика, которая за ним стоит, нам понятна и близка.

❔А вы уже работали с Iceberg на практике, или пока встречали его только в требованиях к вакансиям? Делитесь опытом в комментариях⬇️
  • 🔥 4
  • ⚡ 1
  • 👍 1
More from @awbi_ru
  1. Sep 7, 2026Нашли «дыры» в бизнес-модели. Теперь покажем, как превратить результаты анализа в рост про…
  2. Sep 7, 2026Аналитики разработали гипотезу, что можно повысить продажи через предложение сопутствующих…
  3. Aug 25, 2026Закон Гудхарта⚡️ Есть одна ошибка, которую компании совершают снова и снова. Причём не тол…
  4. Aug 6, 2026✍️Ранее мы писали, что главная проблема ИИ в аналитике - не сама модель, а контекст вокруг…
  5. Jul 31, 2026✨В прошлом посте мы говорили о том, что главная проблема ИИ в аналитике - вовсе не ИИ, а д…
  6. Jul 9, 2026Главная проблема ИИ в аналитике – не ИИ 🐈‍⬛️ За последний год вокруг ИИ появилось столько…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →