инциденты на проде и дубайский потоп
многие события в моем канале освещаются с опозданием по двум причинам: я не хочу нагружать вас слишком частыми постами (поделитесь, кстати, с какой периодичностью постят ваши любимые каналы?) и в жизни происходит слишком много всего на единицу времени
например, в кружочке выше прошедший дождевой катаклизм, после которой минимум трое друзей словили гидроудар, включая машину, на которой мы едем на видео 🌚 из забавного, нас отбуксировали оттуда, но в итоге тачку пришлось вернуть в эту реку, чтобы вызвать полицию и составить протокол
почему так происходит и город каждый раз стоит после сильного дождя?
короткий ответ: неподготовленность к критическому инциденту из-за низкой вероятности
чему тут можно научиться продакту при планировании отказоустойчивости сервисов? давайте проведем параллели!
мониторинг и предупреждение
Дубай: использует метеорологические службы для предсказания сильных дождей (а иногда и вызывает их!)
ИТ: используем надежную систему мониторинга (вот списки популярных систем для мониторинга и алертов), чтобы узнавать о проблемах до пользователей + пробуем применять ИИ для прогнозирования проблем + делаем нагрузочное тестирование + пишем премортемы
борьба с последствиями
Дубай: строит системы водоотведения для минимизации затоплений и быстрого отвода воды
ИТ: делаем стратегию восстановления после сбоев, включая резервное копирование данных и инфраструктуры
real-time реагирование
Дубай: мобилизирует экстренные службы на дорогах и коммуницирует гражданам (отправляет в 6 утра алерты, которые мертвого поднимут)
ИТ: строим an incident response team хотя бы в рамках продуктовых вертикалей, назначаем оунеров, создаем алгоритм эскалации
восстановление после инцидентов
Дубай: быстро возвращается к нормальной жизни (буквально через день следов потопов нет)
ИТ: пишем постмортемы, оцениваем негативный эффект, назначаем команду для устранения последствий и коммуникации юзерам, восстанавливаем системы и данные
что еще почитать по теме инцидентов?
- learning from incidents (by VPT at marriott)
- good old atlassian’s incident management handbook
- как скайенг строил системы работы с инцидентами
- live site review или инциденты в авито
- как озон реагирует на упавший прод
Post #184
5.29K
- 👍 29
- ❤ 17
- ❤🔥 3
- 💯 3
- 👏 1