Подборка реальных вопросов с интервью в Netflix. Направление — масштабируемые системы, отладка на стыке сети и ядра, а также культура хаос-инжиниринга.
⚪️ Round 1 — Systems at Scale, K8s, Cloud & Linux
- Service Discovery: как реализовать гранулярный discovery на 1000+ микросервисов с помощью Envoy или Istio без просадки по перформансу?
- eBPF & Cilium: как с помощью eBPF + Cilium раскатывать network security policies в runtime? В чём профит по сравнению с классическими CNI?
- Multi-Cloud: у Netflix мультиоблачная инфраструктура. Опишите свой подход к кросс-облачному роутингу, управления IAM и синхронизации секретов.
- Troubleshooting: периодически фейлятся systemd-юниты на нодах EKS. Как детектить такие плавающие баги и авто-хилить ноды?
- Golden Images: продуктовые команды просят кастомные AMI. Какую стратегию проверок на уровне ядра и runtime вы внедрите перед продом?
- Kube-probes: продвинутый конфиг liveness/readiness проб в K8s. Как детектить сбои бизнес-логики, если приложения продолжают отдавать 200 OK?
- DNS & Mesh: как справиться с DNS-аутом внутри Service Mesh без полного передеплоя сервисов?
- IaC Incident: бэкенд remote_state в Terraform неожиданно упал по таймауту. Ваш план по восстановлению и локализации ущерба?
⚪️ Round 2 — RCA, Fire Drills & Netflix-Scale Chaos
- mTLS Failure: раскатка нового конфига Envoy незаметно сломала mTLS между edge-слоем и мешем. Как будете строить цепочку RCA (Root Cause Analysis)?
- HPA Stalls: HPA отказывается масштабировать поды, хотя Prometheus показывает CPU > 80%. Пошаговый диагноз с упором на метрики облака и K8s.
- Sidecar Latency: добавили sidecar-кэш для ускорения, но неожиданно подскочил tail latency (p99). Каков ваш план отладки?
- Ghost Outage: ошибки 504 на сервисе воспроизведения. Cloud Load Balancer показывает Healthy, сайдкары в меше зелёные, но видео у юзеров не стримится. Где искать затык?
- FinOps Anomaly: резко выросли расходы на NAT Gateway. При этом релизов и изменений инфры на этой неделе не было. Что могло незаметно вызвать такой спайк?
⚪️ Round 3 — Leadership, Chaos Culture & Engineering Influence
- SRE-культура: как построить инженерную культуру, в которой продуктовые команды реально владеют своими SLO, а не просто игнорируют их?
- Extreme Delivery: нужно задизайнить мультирегиональный фейловер за 3 недели, при этом менять DNS-слой запрещено. Ваш план?
- Release Prep: как спроектировать и провести хаос-тестирование деградации инфры перед премьерой супер-релиза уровня Netflix Originals?
- Exec Pitch: как доказать бизнесу и нетехническим топ-менеджерам реальный ROI от модернизации инфраструктуры?
@DevOpsKaz 😛
