В Kubernetes-продакшене периодически при деплое новых версий сервисов пользователи видят кратковременные 5xx-ошибки. Как вы будете искать и устранять проблему?
Проверю стратегию деплоя (RollingUpdate, Recreate, blue/green), наличие корректных readinessProbe и livenessProbe, а также graceful shutdown (preStop hook). Посмотрю ingress-контроллер и балансировщик трафика. Для решения — правильно настрою health-check’и, стратегию RollingUpdate (maxUnavailable, maxSurge) и обеспечу корректное завершение Pod перед отключением от трафика.
Библиотека собеса по DevOps
Post #778
929