TGViewer
Я – Дата Инженер | Евгений Виндюков Я – Дата Инженер | Евгений Виндюков @halltape_data · 5.94K subscribers
Post #613 3.31K
Архитектура BootCamp для бабушек | Часть 1

Значит, идея возникла давно. Где-то еще при Сталине. Очень бесит, что люди говорят, что на рынке нет релевантных спецов, при этом сами ничего для этого не делают. Спрашивается, откуда возьмутся сеньоры, если мы сейчас не выучим и не вкатим джунов.

Буткемп это мини-копия реальной работы. Т.е. у вас есть Airflow, S3, Spark, Kafka, PG, VSCode, CH, Github, CICD и так далее. И все это взаимосвязано и развернуто на сервере (удаленно). С самого первого дня можно залогиниться, понажимать кнопки, закинуть свой код на сервер через Deploy и посмотреть, как оно работает. И потом на реальном собесе можно смело говорить, что у вас есть ОПЫТ. Да, он не связан с Тб данных, но и не на всех работах у вас будут Тб если что.. И кстати лучше меньше данных, чем много -- они тупо быстрее считаются и с ними меньше проблем по ресурсам.

Итак. Как оно работает оч коротко. Сервер это линукс машина. На ней установлен docker. Докер позволяет запускать ваши программы изолировано от всего мира (их еще называют контейнеры). Ну т.е. можно настроить версии библиотек, языков и так далее в рамках каждого контейнера. И каждый инструмент (airflow, s3, ...) запускается, как отдельный контейнер.

Вот например есть PG (постгрес), S3 и VSCode. Это три контейнера. И пусть мы установим внутри VSCode библиотеку pyspark (именно как библиотеку). Мы хотим например взять наш Spark и прочитать им данные из PG и сохранить в S3. Спарк тут может еще и трансформировать, очистить, преобразовать данные. И вот чтобы это работало четко, надо сделать так, чтобы все три контейнера могли видеть друг друга. Я же писал, что они изолированно запускаются от внешнего мира. Поэтому можно прокинуть общую сеть (типа как у компов в компьютерном зале). Тогда контейнеры могут видеть порты друг друга и уже можно наладить переправку данных.

Но есть еще момент. Весь бекенд Airflow лежит в PG. И для него надо поднимать свой контейнер. Но и мы хотим в PG хранить например синтетические данные. Как быть? Ну можно создать рядом схемы или БД внутри постгреса и прекрасно жить. Можно! И это сильно экономит ресурсы сервера. У нас же всего один контейнер! Но этот вариант хороший только для пет проекта. Если вы хотите разворачивать для нескольких людей - там начинаются нюансы.

▶️ Для тех, кто пропустил
СТРИМ, где показываю BootCamp


Бот для просмотра YouTube
@NamelessNetwork_bot

Промокод: DE
(FREE 2 недели)

Так же в боте можно приобрести роутер со встроенным "ускорителем" YouTube на всех домашних устройствах по единой подписке.

О нюансах расскажу во ВТОРОЙ ЧАСТИ!
  • 🔥 15
  • ❤ 7
  • 👍 2
  • 👏 2
More from @halltape_data
  1. Oct 5, 2026Заглянем внутрь современных инженерных платформ 14 октября Т-Банк приглашает на Platform E…
  2. Oct 4, 2026Чем отличается DROP DELETE и TRUNCATE? Ролик сделал с помощью нейронки. Не знаю, может сто…
  3. Oct 1, 202610 вопросов по SQL для дата инженера https://www.threads.com/share/_vojZtIpk/ Этот пост на…
  4. Sep 27, 2026Собес на 320к на руки на Дата Инженера! ▶️ https://youtu.be/lZKqJ978e1I Выложил собес. Все…
  5. Sep 26, 2026Накрутчики! Написал в Threads пост о том, как расти в ЗП в ДЕ. В комменты пришел человек,…
  6. Sep 25, 2026Это последний поток BootCamp. ВСЁ. После Нового года мы будем поднимать цену. Поэтому нояб…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →