Формат работы: офис
Зп: от 250к
Период собеседования: август 2026
Итог собеседования: прошел в след этап, оффер не принял
Данные и опыт
Можете подробнее рассказать о себе, релевантном опыте, последнем месте работы, задачах, результатах и зоне ответственности?
При помощи чего автоматизировали загрузки?
Какой минимальный интервал возможен между запусками задач в Airflow?
Утоняющие вопросы по рассказу об опыте
Вы агрегировали проверки или сами разрабатывали их?
Как определяли, что запись является ошибочной? Какой скрипт или проверку использовали?
В чём заключалась оптимизация скриптов? Что использовали и почему?
По проводкам: требования и типы проводок вам задавали или вы самостоятельно разбирались в источниках?
Что такое перекос данных?
Что такое spill (спилл) данных?
Много вопросов по коду на экране (такого формата):
1) Найти всех клиентов, у которых нет кредитов (несколькими способами)
-- clients
| client_id | client_name |
|-----------|-------------|
| 1 | Анна |
| 2 | Борис |
| 3 | Вера |
-- credits
| credit_id | client_id | status |
|-----------|-----------|--------|
| 101 | 1 | OPEN |
| 102 | 1 | CLOSED |
| 103 | 3 | OPEN |
2) Какой запрос написать для преобразования?
-- source_data
| id | key | value |
|----|------|-------------|
| 1 | fio | Иван Иванов |
| 1 | city | Москва |
| 2 | fio | Анна Петрова|
| 2 | city | Казань |
-- нужно получить
| id | fio | city |
|----|--------------|--------|
| 1 | Иван Иванов | Москва |
| 2 | Анна Петрова | Казань |
3) Что выведет код?
a = "2"
b = "6"
a,b = b,a
print(a, '-' , b)
values = (9, 11, 96, 130)
result = tuple(filter(lambda x: x % 2 == 0, values))
print(result)
value = "1234"
result = sum(map(int, value))
print(result)
values = [1, 2, 5, 2, 5, 5, 3]
result = max(set(values), key=values.count)
print(result)
items = [[1, 2], [3]]
items[1].append(4)
print(items)
it пингвин | data engineer 🐧
#собеседование #менти