Хороники яростной битвы инженеров Yandex Cloud в Сасово с законами физики.
— Акт первый: Просто моргнул свет.
В 01:44 ночи дежурный мониторинг выкатывает уведомление "Нарушение электропитания в зоне доступности ru-central1-b". Тип инцидента - Unavailable. Следом простыня из трех десятков критических сервисов, от управляемых кластеров Kubernetes и баз данных PostgreSQL до YandexGPT API. И сообщение от саппорта: "Рекомендуем по возможности перенести нагрузку в другие зоны". Любой девопс, пытавшийся в час ночи на коленке мигрировать терабайтные стейтфулсеты и реплики баз данных в соседние зоны, в этот момент 100% нервно заскрежетал зубами... заподозрив неладное
— Акт второй: Давка на выходе.
К пяти утра наступило следствие любой облачной эвакуации. Тысячи перепуганных клиентов ломанулись поднимать упавшие виртуалки в зонах
ru-central1-a и ru-central1-c. Итог закономерен... работающие ДЦ захлебнулись. В 04:55 статус-бот признает, что в других зонах начались проблемы с созданием новых инстансов, баз данных и нод k8s. Свободные аллокации железа тупо кончились. Если у кого не было заранее зарезервированных и оплаченных мощностей в другом регионе, то увы... очередь с ошибками.— Акт третий: Спам в консоли и смерть Serverless.
Ближе к обеду бота мониторинга начало лихорадить... посыпались сообщения об исключении сервисов из инцидента. Выглядело это так, будто инженеры в вручную разруливали связность, по живому пересобирая IAM, VPC, DNS и сетевые балансировщики. Но стоило отчитаться о локализации, как в 14:33 легли Cloud Functions и Serverless Containers... бессерверная магия скорчилась под каскадной нагрузкой уже в масштабах всего облака.
— Акт четвертый: Нервный тик контрол-плейна.
Ближе к вечеру уставшая дежурная смена подарила сетевикам отдельный приступ тахикардии. В 16:46 бот внезапно добавил к списку аварийных зон…
ru-central1-d. Ровно через шестьдесят секунд зону убрали обратно. То ли у кого-то дрогнула рука, то ли соседний кластер на секунду захлебнулся от перегруза - хз. Представляю седые волосы админов, которые в эту минуту смотрели на дашборд — Акт пятый: Признание неизбежного.
Понадобилось почти четырнадцать часов сообщений про "перебои с питанием", чтобы в 15:19 назвать вещи своими именами. Формулировка сменилась на реальную:
Причиной инцидента стал пожар в результате атаки БПЛА на дата-центр в Сасово... Работа дата-центра полностью остановлена.
🤔 Что можно тут сказать... невозможно построить надежную распределенную систему без кратного переизбытка физического железа. Без огромного холодного пула мощностей любое падение крупного ЦОДа гарантированно запускает каскадный отказ всей платформы.
Yandex Cloud выкатил самый тревожный апдейт за эти сутки... в ближайшее время ничего не поднимется
Ситуация с доступностью зоны ru-central1-b пока не изменилась. Наши специалисты продолжают восстановительные работы, однако, по текущим оценкам, возобновить работу зоны в ближайшее время не удастся. Рекомендация остается прежней по возможности задействовать альтернативные планы по восстановлению работы сервисов.
Если чья инфраструктура, БД или единственные копии снапшотов жили исключительно внутри зоны
ru-central1-b - сочувствую. Но урок по Disaster Recovery должен быть усвоен.З.Ы. Вот она, ирония судьбы: больше десяти лет на всех конфах нам говорят, что будущее за эластичными микросервисами, подами и бессерверными функциями. И вот... облачный провайдер предлагает клиентам юзать выделенные физические серверы.
Получается, что облачный инжиниринг сделал полный оборот и вернулся в благословенный 2005 год... ностальгия в глаз попала
_______
Источник | #sysodmins
@F_S_C_P
▪️Генерируй картинки и видео в Mini App:
Flux + Veo 3 + Wan 2.2 + MidJourney v7 + другие