TGViewer
Дмитрий Кузьмин | Инженерия данных Дмитрий Кузьмин | Инженерия данных @kuzmin_dmitry91 · 1.75K subscribers
Post #263 261
Можно отдельно изучить SQL, Spark и Airflow, а потом всё равно не понимать, как связать их в один работающий пайплайн 🥵

Вчера получил отзыв от участника четвёртого потока. Меня особенно зацепило, что он отметил не отдельные технологии, а весь путь от SQL и Spark до Airflow и Metabase, а также большое количество проверок, которые заставляют глубже разбираться в решении.

Для меня это прям супер точное попадание в идею практикума.

Участник не начинает каждый модуль с пустого файла. В уроках есть рабочие шаблоны с TODO: часть логики нужно дописать самостоятельно, запустить код и показать фактический результат.

После этого я лично проверяю схемы, скрипты и данные. На каждое домашнее задание пишу рецензию: показываю, где результат может быть неверным, что стоит дополнительно проверить и как исправить решение. Обычно отвечаю в течение суток, хотя при высокой загрузке иногда требуется больше времени.

🛡 Такой формат требует времени. В среднем проект занимает 6–8 недель, а самые быстрые участники собирали полный контур примерно за месяц. Для старта достаточно среднего SQL, базового Python и готовности работать в терминале. Spark и Airflow заранее знать не нужно: они появляются по ходу проекта вместе с конкретной задачей.

В конце остаётся связный репозиторий, где данные проходят путь от исходных файлов до витрин: PostgreSQL и MinIO используются для хранения, Spark для обработки, Airflow для оркестрации, а проверки качества помогают контролировать результат перед загрузкой в BI.

За пять потоков в практикуме участвовали более 50 человек. Для меня такой формат тоже означает много ручной работы, но именно в ней я вижу смысл практикума: помочь участнику довести проект до состояния, которое он понимает и может объяснить.

По обратной связи уже планирую расширить материалы по моделированию хранилища. Все карты пока раскрывать не буду, но обновление получат участники всех потоков.

🤔 Если ты уже пишешь SQL, но пока не собирал весь путь данных от исходного файла до BI, на странице можно посмотреть программу, примеры сдач и проверить свою входную точку.

Шестой поток стартует 12 октября.
Подробнее - https://kuzmin-dmitry.ru/de_practicum
Stepik - https://stepik.org/a/297679

#DEпрактикум
  • ❤ 6
  • 👍 3
  • 🔥 2
More from @kuzmin_dmitry91
  1. Sep 22, 2026Почему RAG-бот иногда отвечает «не знаю» ✍️ В августе я только начинал погружаться в RAG и…
  2. Sep 18, 2026У блога появился свой герой 🐻 В последнее время здесь много пайплайнов, проверок качества…
  3. Sep 15, 2026💬 Какой результат SQL отправить бизнесу? Ребят, одна из частых ошибок в SQL-задачах состо…
  4. Sep 11, 2026Когда пайплайн упал в пятницу в 18:30, но дежуришь не ты. С пятницей! Пусть выходные пройд…
  5. Sep 10, 2026Сначала выучу весь DE-стек У меня переход в Data Engineering тормозился примерно на этой м…
  6. Sep 4, 2026Наконец-то нормальное объяснение JOIN 😆 С пятницей!
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →