Условно разобью по актам для удобства чтения.
🟢Акт первый: Просто моргнул свет.
В 01:44 ночи дежурный мониторинг выкатывает уведомление "Нарушение электропитания в зоне доступности ru-central1-b". Тип инцидента - Unavailable. Следом простыня из трех десятков критических сервисов, от управляемых кластеров Kubernetes и баз данных PostgreSQL до YandexGPT API. И сообщение от саппорта: "Рекомендуем по возможности перенести нагрузку в другие зоны". Любой девопс, пытавшийся в час ночи на коленке мигрировать терабайтные стейтфулсеты и реплики баз данных в соседние зоны, в этот момент 100% нервно заскрежетал зубами... заподозрив неладное 😶
🟢Акт второй: Давка на выходе.
К пяти утра наступило следствие любой облачной эвакуации. Тысячи перепуганных клиентов ломанулись поднимать упавшие виртуалки в зонах
ru-central1-a и ru-central1-c. Итог закономерен... работающие ДЦ захлебнулись. В 04:55 статус-бот признает, что в других зонах начались проблемы с созданием новых инстансов, баз данных и нод k8s. Свободные аллокации железа тупо кончились. Если у кого не было заранее зарезервированных и оплаченных мощностей в другом регионе, то увы... очередь с ошибками.🟢Акт третий: Спам в консоли и смерть Serverless.
Ближе к обеду бота мониторинга начало лихорадить... посыпались сообщения об исключении сервисов из инцидента. Выглядело это так, будто инженеры в вручную разруливали связность, по живому пересобирая IAM, VPC, DNS и сетевые балансировщики. Но стоило отчитаться о локализации, как в 14:33 легли Cloud Functions и Serverless Containers... бессерверная магия скорчилась под каскадной нагрузкой уже в масштабах всего облака.
🟢Акт четвертый: Нервный тик контрол-плейна.
Ближе к вечеру уставшая дежурная смена подарила сетевикам отдельный приступ тахикардии. В 16:46 бот внезапно добавил к списку аварийных зон…
ru-central1-d. Ровно через шестьдесят секунд зону убрали обратно. То ли у кого-то дрогнула рука, то ли соседний кластер на секунду захлебнулся от перегруза - хз. Представляю седые волосы админов, которые в эту минуту смотрели на дашборд 👨🦳🟢Акт пятый: Признание неизбежного.
Понадобилось почти четырнадцать часов сообщений про "перебои с питанием", чтобы в 15:19 назвать вещи своими именами. Формулировка сменилась на реальную:
Причиной инцидента стал пожар в результате атаки БПЛА на дата-центр в Сасово... Работа дата-центра полностью остановлена.
🤔 Что можно тут сказать... невозможно построить надежную распределенную систему без кратного переизбытка физического железа. Без огромного холодного пула мощностей любое падение крупного ЦОДа гарантированно запускает каскадный отказ всей платформы.
Типичный 🥸 Сисадмин
