TGViewer
KazDevOps KazDevOps @devopskaz · 6.87K subscribers
Post #1976 1.5K
Safety_I_and_safety_II_the_past_and_future_of_safety_Erik_Hollnagel.pdf37.6 MB
🔥 А если взглянуть на SRE и любую «надежность» с другого угла?

Сегодня немного философии.

Есть такая модель Safety-II, которая в отличии от традиционного подхода (минимизация негативных факторов, приведших к сбою) предлагает сосредоточиться на развитии позитивных факторов — на повседневной работе, которая раз за разом предотвращает аварии. Вместо вопроса «Почему всё пошло не так?» можно спрашивать себя «Как сделать так, чтобы всё работало правильно?». В конце концов, мы измеряем доступность «девятками» (99,9% или 99,99%).

Эта идея кажется нам как инженерам настолько непривычной, что она буквально противоречит знаниям о том, как ломаются системы. В чем главная проблема?

Мы живем с установкой, что надежность — вещь пассивная: мол, по умолчанию система должна работать стабильно, а чтобы она сломалась, кто-то должен активно сделать что-то не так. Мы воспринимаем повседневную работу людей внутри системы как потенциальную угрозу для надежности.

Если рассматривать адаптивные действия сотрудников только в контексте инцидента и пытаться повысить надежность за счет их запрета, это будет похоже на попытку понять, как выиграть в лотерею, изучая поведение победителей. Существует гораздо больше проигравших, которые вели себя точно так же, просто мы на них не смотрим.

❗️ Приложили книгу Safety-I and Safety-II The Past and Future of Safety Management для тех, кто захочет глубже копнуть в эту тему.

Почему внедрить Safety-II сложно?

⚪️Компании попросту не привыкли изучать свою нормальную деятельность, чтобы ответить на вопрос: «Что у нас получается особенно хорошо и как масштабировать этот успех?»

⚪️Внимание внутри организации — ограниченный ресурс. Если все индикаторы «зеленые», это воспринимается как сигнал, что мы можем со спокойной душой переключить бюджет внимания на что-то другое.

⚪️В сфере технологий большая часть нашей работы фактически невидима: мы сидим один на один с компьютером.

Пока мы философствуем, специалисты по устойчивости ПО уже пытаются подтолкнуть индустрию в этом направлении, побуждая людей иначе взглянуть на то, какую пользу можно извлечь из анализа инцидентов, но впереди еще долгий путь.


@DevOpsKaz 😛
More from @devopskaz
  1. Sep 22, 2026⚡️ FinOps для Superapps & MiniApps: как перестать переплачивать за инфраструктуру На предс…
  2. Sep 21, 2026👋🏻 Всем привет! Если вам интересны мобильная разработка, архитектура приложений, AI и ин…
  3. Sep 21, 2026🔥 Образовательный дайджест сентября ⚪️ Администрирование ОС Linux Kernel panic: что делат…
  4. Sep 18, 2026🔥 Спикер №8 DevOpsDays Almaty'26 — Байгашев Мирас, DevOps Team Lead, Core 24/7 Мирас упра…
  5. Sep 18, 2026⚡️ Героизм в SRE: как выявить системную проблему и перестать на неё закрывать глаза Google…
  6. Sep 17, 2026🔥 PostTechHackathon — 25-27 сентября Участникам предстоит решить два реальных технологиче…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →