19:07. Падает один сетевой контроллер. Сервисы зарезервированы. Вроде ничего страшного?
Примерно через час в Yandex Cloud уже каскадом отказывают узлы внешней связности. В какой-то момент проблемы одновременно затрагивают две зоны доступности.
Как из одного отказа получился большой региональный инцидент?
Мне здесь понравился один момент: довольно быстро проблема перестала быть только про сломанный контроллер. Система начала сама добавлять себе работы.
После сбоя запустились миграции части виртуальных машин. Сам по себе механизм нормальный, для этого он и существует. Но в условиях аварии миграции создавали дополнительные служебные запросы. Пользовательский трафик не вырос, а внутренней нагрузки стало в разы больше.
И это был только один слой. По сути, контроллер дал первый толчок, а дальше несколько факторов неудачно совпали и начали усиливать друг друга.
В ретроспективе Яндекса для этого приводят модель «швейцарского сыра»: у каждого защитного слоя есть свои слабые места. Обычно следующий слой страхует ситуацию. Но иногда дырки внезапно выстраиваются в одну линию.
И мне кажется, разбирать такие цепочки намного интереснее, чем просто найти один root cause и успокоиться.
Если на postmortem вы нашли убедительную первопричину, продолжаете копать дальше? Или обычно на этом расследование заканчивается?
Пишите в комментариях 👇
А если хочется раскопать этот кейс целиком, у Яндекса есть подробная ретроспектива с таймлайном и списком изменений, которые они внедрили после инцидента.
Post #365
738

- ❤ 5
- 👍 3
- 💯 2