Databricks сделал общедоступными тип
VARIANT и механизм Variant Shredding для таблиц Delta Lake и Iceberg.Полуструктурированные данные остаются в одной
VARIANT-колонке, но часто встречающиеся поля физически записываются отдельными колонками в Parquet. Запрос читает только нужные поля, лучше сжимает данные и может использовать статистику и пропуск файлов.Для инженеров это компромисс между хранением сырого JSON и жёсткой схемой: новые поля можно принимать без миграции таблицы, а популярные — читать с производительностью обычных колонок. Цена — дополнительные затраты при записи; уже загруженные данные не преобразуются автоматически и требуют
REORG TABLE ... SHRED VARIANT.#databricks #deltalake #apacheiceberg #parquet #semistructureddata #dataengineering #lakehouse
@data_engi