TGViewer
Айти-Пингвин | Дата инженер Айти-Пингвин | Дата инженер @data_penguin · 2.11K subscribers
Post #257 1.99K
Обзор собеседования с Лемана Про

Формат работы: Гибрид
Зп: от 250к просил
Период собеседования: Июль 2026
Итог собеседования: Игнор

————

Общий опыт работы

С какими базами данных вы работали и до какого уровня погружались в SQL и БД?

Миграция Oracle → Greenplum

Опишите подробнее процесс миграции на Greenplum. Какие особенности необходимо было учитывать?

Какая конфигурация использовалась в Oracle — распределённая или обычная СУБД?

Приходилось ли оптимизировать операции join при переходе с обычной таблицы на распределённую?

Применялась ли индексация в Greenplum в вашей практике?

Задача на проектирование (геоданные)
Дана таблица с географическими координатами полигонов. Каким образом можно ускорить поиск по координатам без использования полигонального индекса?

Как можно применить дистрибуцию или партиционирование для оптимизации запросов по числовым координатным полям?

Какой принцип должен лежать в основе распределения данных для эффективного использования всего кластера?

Языки программирования
Расскажите об опыте работы с языками программирования, в частности с Python.

Насколько глубоко изучен API Apache Airflow? Какие классы операторов и задач применялись?

Использовались ли внутренние механизмы Airflow — переменные, XCom?

Применялись ли генераторы задач или динамические DAG?

Проектирование pipeline

Как бы вы спроектировали pipeline для загрузки таблиц из Oracle в Greenplum?

Каким образом следует организовать запуск: единый DAG или отдельные DAG для каждой таблицы?

Какие преимущества и недостатки имеет каждый из подходов — универсальный DAG с множеством задач против отдельных DAG на каждую таблицу?

Контроль качества данных

Каким образом обеспечивается контроль качества загруженных данных?

Опишите верхнеуровневую структуру отчёта по контролю качества данных (data quality).

Опыт с Hadoop-стеком

Расскажите подробнее об опыте работы с экосистемой Hadoop.

В каком окружении использовался PySpark?

С какими форматами файлов приходилось работать (Parquet, CSV, ORC)?

Хранились ли данные в объектном хранилище?

Имеется ли опыт работы с технологиями каталогизации и версионирования данных, например Apache Iceberg?

DevOps и инфраструктура
Имеется ли опыт применения практик DevOps и SRE?

Есть ли опыт работы с Docker и Kubernetes?

Использовались ли инструменты мониторинга и логирования, такие как Grafana или Loki?

Управление кодом БД и архитектура хранилища

Как организован процесс работы с кодом, относящимся к базе данных, включая развёртывание процедур, функций и таблиц?

Какой процесс применяется для деплоя изменений в продуктивную среду?

Опишите архитектуру хранилища данных: какие слои используются и как формируются витрины данных?

————

Вот это уже потненький собес. Не то что в Сбере)

it пингвин | data engineer 🐧

#собеседование #менти
  • 👍 11
  • 🔥 7
  • 😱 3
  • ❤ 2
  • ✍ 2
  • 😢 1
More from @data_penguin
  1. Sep 25, 2026Обзор первичного скрининга с Ozon tech Этапы отбора: hr->тех скрининг->основной тех собес-…
  2. Sep 24, 20265 октября начнется 19-й поток программы Data Engineer от Newprolab Программа для junior- и…
  3. Sep 18, 2026Обзор собеседования с ВТБ Формат работы: офис Зп: от 250к Период собеседования: август 202…
  4. Sep 16, 2026Из аналитика в DE - реально? 🐧 Регулярно в дата-комьюнити вижу вопрос: «А как вообще пере…
  5. Sep 4, 2026В продолжение поста о токсичном собесе Мне в личку написал подписчик и тоже рассказал заба…
  6. Sep 3, 2026Чет у нас кодекс отвалился, а как работать теперь?..🍴 https://status.openai.com/
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →