Пост для тех, кто уже перерос базовые туториалы и столкнулся с суровой реальностью эксплуатации.
Существует огромный разрыв между пониманием базовой теории Kubernetes и реальным поддержанием жизнеспособности EKS-кластера в продакшене. Практическое руководство по траблшутингу поможет закрыть пробелы и ответит на самые болезненные вопросы при сбоях инфраструктуры.
➖ Что делать, когда поды переходят в статус
Pending, а очевидных причин для этого нет?➖ Как точно определить, является ли DNS первопричиной проблемы или это лишь симптом другого сбоя?
➖ Почему ваш сетевой балансировщик (NLB) постоянно сбрасывает соединения?
➖ Как правильно и быстро собрать улики и логи до того, как сработает автохилинг (самовосстановление) кластера и уничтожит все следы, необходимые для анализа причин аварии?
➖ И еще десяток важных вопросов, раскрытых на кейсах
Самое главное — автор объясняет, как не сойти с ума, когда всё идет не по плану.
Сохраняйте себе и делитесь с коллегами 🫡
@DevOpsKaz 😛
