TGViewer
Data Engineer Data Engineer @dataengineernews · 478 subscribers
Post #275 206

Forwarded from DataJourney

Teradata row partitioning (PPIs) VS Snowflake clustering

Неожиданный пост в контексте недоступности этих вендоров в России, но очень интересный в тематике канала.

Недавно наткнулся на заметку широко известного в узких кругах автора Roland Wenzlofsky. В ней автор раскрывает тонкости реализации партиционирования в Teradata и Snowflake.
T - каждый блок данных, удовлетворяющий условию партиционирования физически лежит отдельно, таким образом чтение/изменение данных по ключу затрагивают всегда ожидаемый набор блоков;
S - абсолютно все данные рабиваются на мелкие микро-партиции, а уже для выполнения условия партиционирования собираются отдельные файлы статистики, которые указывают в каких микро-партициях находятся искомые данные по ключу партицирования, таким образом чтение/изменение данных по ключу затрагивает всегда случайный набор блоков.

Исходя из этих знаний можно найти плюсы и минусы одинаковой с точки зрения маркетинга функции:

Teradata Row Partitioning
➕Явное указание партиций → предсказуемость всегда.
➕Отличная производительность, когда предикаты совпадают с ключами разделения.
➕Нулевые затраты на выполнение запросов сверх начальной настройки.
➖Жёсткая структура. Изменение ключа партиционирования требует перезаписи всей таблицы.
➖Требует специальных знаний для проектирования структуры.
➖Неправильный дизайн = плохая производительность вплоть до необходимости редизайна.

Snowflake Clustering
➕Работает из коробки всегда, даже если вы явно не указали на необходимость партиционирования.
➕Гибкость: условия партиционирования могут быть добавлены, изменены или удалены в любое время
➕Нет необходимости заранее проектировать структуру.
➖Недетерминированность: качество проброски запроса к данных зависит от укладки данных в микро-партиции.
➖Поддержка кластеризации потребляет вычислительные ресурсы всегда.
➖Большие беспорядочные обновления быстро ухудшают эффективность.
➖Постоянный мониторинг или автоматическая кластеризация увеличивают операционные расходы.
More from @dataengineernews
  1. Sep 27, 20262️⃣3️⃣✖️0️⃣✖️2️⃣6️⃣ 🦀 Big Data дайджест · 22–23 сентября 2026 🍄 CLICKHOUSE • На этой нед…
  2. Sep 23, 2026Кабанчик приехал
  3. Sep 12, 2026LLMSQLQueryOperator В Airflow появился новый декоратор task.llm_sql, который генерирует SQ…
  4. Sep 2, 2026Кабанчик уже не тот https://t.me/alexgladkovblog/7608
  5. Aug 25, 2026Apache Airflow 3.3.0: Stateful Tasks and Multi-Language Support В Airflow 3.3 появился AIP…
  6. Aug 25, 2026Продолжая закрывать свой букдолг, дошел до книги Питхейна Стренгхольта «Архитектура медаль…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →