Официальный постмортем падения AWS
20 октября 2025 года.https://aws.amazon.com/message/101925/
1. С чего началось?
В результате Race condition (когда несколько процессов обновляют одну и ту же конфигурацию) при обновлении Route53 эндпоинт
dynamodb.us-east-1.amazonaws.com удаляется.Всё, нет такого домена, до свидания, DynamoDB.
race condition resulted in an incorrect empty DNS record for ... endpoint... the system was left in an inconsistent state... manual operator intervention to correct.
Никаких DDoS, сетевых перенагрузок - тупо ошибка автоматизации (
2. It is always DNS.
И это был DNS.
endpoint resolution failures for DynamoDB ...
... triggered by a latent defect within the service’s automated DNS management system ...
3. Падаем громко.
EC2 не стартуют, равно как Lambda, SQS, ECS/EKS, Redshift и другие критически важные сервисы.
During this period, customers and other AWS services with dependencies on DynamoDB were unable to establish new connections...
4. Первый фикс.
DNS для DynamoDB руками починили за 2–3 часа, но сервисы восстанавливались медленно — пока у всех не заэкспарился кеш DNS.
As cached DNS records expired ... completed recovery from the primary service disruption event.
... manual operator intervention to correct.
5. Partial monitoring blind.
Некоторое время никто не знает, что реально происходит, т.к. и CloudWatch, и внутренний мониторинг работают с перебоями.
The alternating health check results increased the load on the health check subsystem, causing it to degrade...
6. Почему упал не только один регион N.Virginia
us-east-1?Ключевые сервисы - IAM, CloudFront, CloudFormation, Route53 и др. - исторически живут исключительно в
us-east-1. Поэтому проблема с ними = проблемы у всех регионов.Customers with IAM Identity Center configured in N. Virginia (us-east-1) Region were also unable to sign in...
Моё предположение, что это падение наконец-то станет окончательным поводом пересмотреть архитектуру 20-летней давности (пока) не оправдалось.
Принято решение:
- написать ещё тесты (но они ведь были, да?)
- переписать throttle и velocity control (условно rate limit на массовые рестарты или скелинг)
- добавить защиту для DNS Planner (система создания плана с айпишниками сервиса) и Enactor (система, которая пушит этот план в Route53)
- уволить оставшихся девопсов
We are building an additional test suite ... improve the throttling mechanism ... add additional protections to prevent the application of incorrect DNS plans.
7. Как развивалось дальше?
Сервисы недоступны или throttle-ятся долгое время, т.к. проблемы, вызванные DynamoDB DNS и недоступность ключевых сервисов столь длительное время ранее не тестировалось.
8. Когда решили проблему и началась стабилизация?
15 часов.
Итого.
Всё равно жду появления в бэклоге AWS своего IAM для каждого региона.
Вряд ли дождусь, но жду.
