Непосредственной причиной сбоя стало перенасыщение сетевого трафика на балансировщиках нагрузки в регионе Central US из-за нового пика активности.
Первоисточником проблемы стал pod с sidecar-контейнером Istio: он уперся в лимиты по параллельным запросам и не смог корректно смасштабироваться (auto scale). Это произошло из-за ошибки в конфигурации политики масштабирования, которая отслеживала параметры основного хостового сервиса, но игнорировала лимиты самого sidecar-контейнера.
Сбой одного компонента вызвал каскадную реакцию, в результате чего четыре узла HAProxy исчерпали свои лимиты по количеству соединений (flow limits). Это привело к деградации шлюза аутентификации и массовым задержкам/ошибкам при входе пользователей.
Ситуацию усугубила слишком оптимистичная логика повторных запросов (retry logic), которая создала избыточную нагрузку на внутренние балансировщики. Одновременная приостановка работы HAProxy на проблемных узлах сразу же привела к восстановлению системы
.