— Возможность указывать (подмножество колонок, явное указание типа данных) и не указывать (
SELECT *) схему данных для создаваемых таблиц-источников— Заполнение всех данных по каждому источнику: docs, freshness, tags
🔴 dbt test (CI) - полноценный конвеер Automated Tests с Github Actions 🔴
Ключевая идея в том, чтобы в независимом окружении (TEST) собрать проект и убедиться, что результаты соответствуют ожиданиям:
— Код в принципе работает (compile)
— Модели собираются в объекты в БД (run)
— Пройдены все тесты (test)
При этом сделать это оптимальным образом:
— Единый универсальный workflow для всех задач CI
— Уменьшенный объем данных (быстро)
— При необходимости, только изменяемый подграф - DAG subset (еще быстрее)
Once PR is opened:
— Build related docker image
— Deploy code to TEST
— Run tests
After PR is closed (merged or rejected):
— Remove transient database schema
— Remove linked docker image as well as old/untagged images from container registry
✅ Скоро добавлю мысли и по этим идеям: ✅
— Разрабатываю и тестирую Github Actions локально с Act CLI + actionlint
— Persist docs - Автоматически актуализировать документацию/описания объектов dbt в DWH и далее (downstream)
— Пирамида создания ценности в Data
— Мне очень понравился Apache Superset и впредь я бы рекомендовал его как замену популярным managed / proprietary BI (Looker, Datalens, Tableau, PowerBI, etc.)
— Квест с поиском исчезнувших записей - Debezium, Kafka Connect, Snowflake Sink
— Data Compaction в Object Storage (S3 / OBS / MinIO) - множество мелких файлов в один .parquet
— Clickhouse production-ready deployment checklist + configurations as code
— В целом кристаллизовались идеи по поводу направлений (видов) деятельности в Data
— 2025Q1 PERFORMANCE SELF REVIEW + PLANS
💬 А пока - давайте обсудим!
Давно не общались. У кого какие новости?
🌐 @data_apps | Навигация по каналу