TGViewer
Agentic Engineer Agentic Engineer @data_engi · 686 subscribers
Post #1210 157
Databricks раскладывает JSON по колонкам без фиксированной схемы

Databricks сделал общедоступными тип VARIANT и механизм Variant Shredding для таблиц Delta Lake и Iceberg.

Полуструктурированные данные остаются в одной VARIANT-колонке, но часто встречающиеся поля физически записываются отдельными колонками в Parquet. Запрос читает только нужные поля, лучше сжимает данные и может использовать статистику и пропуск файлов.

Для инженеров это компромисс между хранением сырого JSON и жёсткой схемой: новые поля можно принимать без миграции таблицы, а популярные — читать с производительностью обычных колонок. Цена — дополнительные затраты при записи; уже загруженные данные не преобразуются автоматически и требуют REORG TABLE ... SHRED VARIANT.

#databricks #deltalake #apacheiceberg #parquet #semistructureddata #dataengineering #lakehouse

@data_engi
Databricks Use variant shredding to optimize performance | Databricks on AWS Variant shredding on Databricks improves query performance on VARIANT columns by storing commonly occurring fields as separate Parquet columns, reducing I/O and improving compression.
  • ❤‍🔥 2
More from @data_engi
  1. Oct 6, 2026Post #1399
  2. Oct 5, 2026@data_engi
  3. Oct 5, 2026С днём учителя! @data_engi
  4. Oct 5, 2026Промптом можно пролезть без очереди на LLM-сервере 😁 2 октября исследователи описали JIL…
  5. Oct 5, 2026Iceberg Kafka Connect перестал молча терять данные при ошибке записи 👈 В Apache Iceberg 1…
  6. Oct 4, 2026От "наши LLM - мирового уровня" до "но нужно трезво смотреть на вещи..." прошла одна блоки…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →