Моя топовая история починки чего-либо тянулась нон-стоп 32 часа.
Это был Greenplum заказчика, который несколькими последовательными командами gprecoverseg вывели в «нештатный» режим. Ночная смена под жестким sla плюс неудачное стечение обстоятельств.
Через примерно час я сказал что кластеру хана и данным хана, и пошел восстанавливать из бекапа. Пока команда инцидента из 6 или 8 человек проходила стадии Отрицание-Гнев-Торг-Принятие, терабайты уже поднимались в резерв кластер.
Потом звали вендора, искали причину, писали бумажки, клялись-божились что больше никогда-никогда. Нагоняли с заказчиком дельту из источников, крепились под нагрузку х4 от обычной. Перенастраивали DNS и все виды коннектов-фаерволлов на резервный кластер.
Были веселые выходные. Бизнес-заказчик в понедельник увидел отчеты как ни в чем ни бывало.
Записали как учения по отказоустойчивости 🤪
Post #768
968
Архитектор Данных Ваше ХД не встает после ребута. Какую систему вы сможете лично сами починить (оживить, поднять из бекапа)?
- 🔥 21
- 🤯 2
- 👍 1
- 👌 1
- 😇 1