Вчера вечером в МСК у Timeweb случился масштабный сбой — и подкинул нам вагон проблем.
Коротко по таймлайну хостера: 9 апреля около 20:00 виртуалки в зоне MSK-1 поехали по latency — затупила дисковая подсистема.
Ночью инженеры поэтапно чинили сегменты хранилища (8 штук, по очереди). К утру стало легче, но выяснилось, что часть машин висит намертво — ни SSH, ничего.
Лечилось только перезагрузкой нод целиком.
Финальную точку поставили к 17:15 10 апреля — почти сутки веселья.
Год назад мы так же красиво мигрировали с Beget после их сбоя — думали, ну всё, заживём.
И год прожили нормально: мелкие падения случались, но решались на раз.
У меня паранойя, поэтому всё задублировано по схеме «3 разные точки × 2».
Запасные базы, запасные мощности — переключились и поехали дальше.
Но вчерашнее — это что-то новое. У хостера легли 4 из 6 нод в Москве, где стояла наша инфраструктура. А потом, кажется, своими же руками добили оставшиеся две во время восстановления. Когда падает половина дата-центра разом — никакое резервирование внутри одного хостера тебя не спасает.
Итог: бессонная ночь, красные глаза и новый опыт в копилку.
Уже начал прорабатывать следующую схему — с расчётом на то, что у одного и более провайдера может лечь всё сразу.
Надеюсь, до следующего раза (надеюсь, не скоро) успею доделать и развернуть.
Кстати, краем уха слышал — у тех, кто держал ТГ-ботов на зарубежных серверах через российских хостеров, вчера тоже было весело. Может, совпадение, может, очередной этап ТСПУ. Копаться в причинах сейчас нет ни сил, ни желания — надо в текущих реалиях обеспечивать стабильность.
