Обычно мы стараемся сделать инфраструктуру максимально стабильной.
А в chaos engineering подход обратный: специально создаём сбои и смотрим, переживёт ли их система.
Для Kubernetes есть интересный open-source инструмент — Chaos Mesh.
Он позволяет имитировать, например:
⚡ падение Pod
🌐 проблемы с сетью и DNS
🐢 задержки HTTP
💾 ошибки I/O
⏰ изменение системного времени
🔥 нагрузку на CPU и память
☁️ сбои в AWS, Azure и GCP
Эксперименты описываются Kubernetes-ресурсами, поэтому ими можно управлять привычными инструментами Kubernetes.
Есть также Dashboard, расписания экспериментов, Workflow и проверки состояния приложения.
То есть можно проверить сценарий вроде:
«Что произойдёт, если один Pod внезапно исчезнет, сеть начнёт тормозить, а затем сервис потеряет доступ к диску?»
Лучше узнать ответ на этот вопрос в тестовом окружении, чем ночью в production
💬А какой сбой вы бы первым делом специально устроили своей системе для проверки?
#kubernetes #devops #opensource #sre
