29 мая Microsoft опубликовала постмортем крупного инцидента Azure OpenAI Service. С 09:39 до 17:05 UTC пользователи в нескольких регионах столкнулись с задержками, ошибками и HTTP 5XX.
🔤 Почему проблему нашли не сразу
Первые симптомы появились в Australia East. Инженеры отключили компонент, который выглядел виновником, и одновременно нагрузка начала снижаться.
Позже аналогичная ситуация повторилась в Sweden Central и стало понятно, что причина — retry storm от внутреннего клиента.
💡 Проблема была не в ретраях, а в изменении семантики ошибки.
Ошибка, которую раньше не ретраили, внезапно стала считаться временной. Этого хватило, чтобы локальная проблема превратилась в масштабный инцидент.
❗️ Проверьте, какие ошибки считаются ретраибельными в ваших сервисах. Иногда один неверный retry может нанести больше вреда, чем внешний DDoS.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека devops'a
#разбор_полётов