Гонка за новым функционалом не должна превращать систему в «хрупкого гиганта». SRE-практики помогают определить «точку невозврата» и выстроить процессы поддержки SLA. Если вы хотите научиться проектировать устойчивые системы и оберегать их от неожиданных падений, секция «Reliability Engineering» будет для вас незаменима.
Вторая часть докладов секции ⤵️, первая здесь
1) Blameless culture. Как правильно работать с инцидентами. Андрей Синицын (Ozon)
Принцип старой школы: «у любой проблемы есть имя и фамилия». Слышали? Может, сами практикуете или бывали такими именем и фамилией? Из доклада вы узнаете, почему культура без обвинений более эффективна, почему это не про всепрощение и расслабон и как запустить такой подход у себя.
2) Как жить, когда у тебя N тысяч алертов в секунду. Кирилл Борисов (VK)
Доклад про цикл жизни систем алертинга — от самого зарождения, когда только нащупываются подходы, до уже зрелой системы со своим собственным флоу.
3) Непрерывность как вид искусства. И почему доступности в 3,5 девятки вам достаточно. Глеб Тильтиков (МТС Диджитал)
Глеб расскажет о реальном применении SRE-практик, на личном примере рассмотрит оправданное добавление ещё одной девятки и когда от заботы о «pets» нужно переходить к «cattle».
🖐️ Ждём вас 7 и 8 апреля в Москве на DevOpsConf 2025.
✅ Программа конференции и билеты на сайте
Post #1333
3.41K

- 🔥 2
- 👍 1
- 👏 1