TGViewer
Сохранёнки программиста Сохранёнки программиста @prog_stuff · 6.52K subscribers
Post #3052 173
Как Apache Hudi отсекает лишние партиции и файлы

Это первая часть обстоятельного разбора индексной подсистемы Hudi. Материал объясняет, как таблица метаданных ускоряет поиск записей и помогает не читать заведомо лишние данные.

Таблица метаданных сама устроена как Hudi Merge-on-Read и разделена по типам индексов. В HFile ключи отсортированы, а индекс блоков помогает найти нужный блок в памяти и прочитать его с диска.

По умолчанию работают индексы файлов, статистики столбцов и статистики партиций. Для условия price >= 300 Hudi сначала отбрасывает партиции по максимумам цен, затем файлы по статистике отдельных столбцов.

Индексы обновляются в той же транзакции, что и данные, а уплотнение запускается после каждых 10 операций записи в таблицу метаданных. Инженерам данных стоит сверить набор индексируемых столбцов: без явной настройки Hudi берёт первые 32.
More from @prog_stuff
  1. Oct 6, 2026Почему BPF LPM trie замедляется с ростом таблицы префиксов Обстоятельный разбор сбоя Cloud…
  2. Oct 3, 2026Go расширил экспериментальный SIMD без ассемблерных вставок В Go 1.27 разработчики предста…
  3. Oct 3, 2026Отредактировал снимок билета без сброса криптографической даты В стандарте C2PA подпись св…
  4. Oct 3, 2026Как искать баги, которые не воспроизводятся в тестах В обстоятельном разборе трёх расследо…
  5. Oct 3, 2026Producer-Consumer в Java, Go и Rust: как выбрать уровень решения Разбор трёх способов связ…
  6. Oct 2, 2026Как искать нарушения IEEE 754 в математических ядрах ИИ-ускорителей Обстоятельный разбор а…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →