TGViewer
DevOps для ДевоПсов DevOps для ДевоПсов @devo_pes · 3.21K subscribers
Post #7993 173
Как выстроить управление инцидентами по модели Google и PagerDuty

При крупном сбое мало искать первопричину: нужно одновременно снижать влияние, координировать команды и сообщать о ходе работ. В Google процесс основан на Incident Command System, системе с заранее определёнными ролями и линией подчинения.

Incident Commander координирует реагирование, Operations Lead устраняет последствия и восстанавливает сервис, Communications Lead обновляет участников и заинтересованные стороны. Команды при этих ролях могут расширяться или сокращаться по мере необходимости.

До следующего сбоя назначьте роли, согласуйте порядок связи, ведите журнал отладки и принятых мер, объявляйте инцидент на ранней стадии и отрепетируйте процесс. Четыре разбора и стартовый чеклист собраны в главе Incident Response на сайте Google SRE.
sre.google Google SRE - Root Cause Analysis for Probing Incident Google and PagerDuty leverage root cause analysis in incident management. Learn from real-life case studies, and insights into incident response.
More from @devo_pes
  1. Sep 25, 2026✨ Как настроить PostgreSQL для продакшен-нагрузок При переходе к продакшен-нагрузкам важно…
  2. Sep 25, 2026Что на самом деле ограничивает max_locks_per_transaction в PostgreSQL Параметр задаёт долю…
  3. Sep 25, 2026Как не получить ложный пик в Prometheus при агрегации счётчиков Для счётчиков порядок опер…
  4. Sep 24, 2026Как отслеживать сбои и замедление тестов Cypress в Grafana Cloud Один лог CI не показывает…
  5. Sep 24, 2026Как перенести сервис Kubernetes из default без простоя Десятки сервисов обращаются к auth-…
  6. Sep 24, 2026Как находить нестабильные тесты с помощью merge queue и main Если merge queue гарантирует,…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →