Это произошло, быстро, внезапно и больно. Одна ошибка автоматизации парализовала большую часть рынка и привела к потере огромных сумм.
Что мы имеем:
Дефект в подсистеме автоматического управления DNS сгенерировал неверный план изменений, и разрешение эндпоинтов DynamoDB перестало работать. По сути возник race condition при обновлении записей Route 53: запись для dynamodb.us-east-1.amazonaws.com была удалена, что нарушило доступ к региональным endpoint'ам и вызвало каскадную деградацию сервисов, зависящих от DynamoDB.
И вот бедные владельцы бизнеса ждали больше 15 часов пока кэш заэкспариться на сервере и обработает наконец их запросы.
Что делать, чтобы предотвратить крах на своей стороне?
Предусмотрите возможность failover в другом облаке, минимизируйте single points of failure и и максимально автоматизируйте и тестируйте восстановление.
И если у вас ещё раз спросят, зачем нужен DevOps, то просто скажите, что DevOps предотвращает подобные инциденты и помогает минимизировать их последствия.