На докладах секции «Reliability Engineering» поговорим про надёжность, устойчивость и способность быстро восстанавливаться после сбоев. Математика про девятки в наличии.
Первая часть докладов секции:
1) Математика починки инцидентов. Вадим Мартынов (Яндекс)
Время — наш злейший враг, особенно, когда идет большой инцидент. За счет каких механизмов и процессов можно уменьшить время на каждом из этапов инцидента, узнаете из доклада Вадима.
2) Лучшие практики управления инцидентами в Lamoda. Илья Машичев (Lamoda Tech)
Доклад посвящён двум ключевым аспектам управления инцидентами: эффективной ролевой модели во время инцидента и процессу Postmortem. Как правильно назначать роли, распределять функции и ускорять решение? Ответ вы найдете в докладе Ильи.
3) Мониторинг и SLA на фронтенде: где брать метрики, когда их не хватает и как не высасывать из пальца SLI. Иван Щукин (Купер (ex СберМаркет))
Когда нам говорят о метриках доступности, мы обычно думаем про availability и latency. Но применим ли такой подход к frontend-приложениям? В докладе Ивана по полочкам разложено, на что обратить внимание, а главное, как мониторить frontend, выбирая правильные метрики.
4) DRP для высоконагруженных динамических финтех-систем. Михаил Соловьев (Т-Банк)
Михаил поделится вариантом работы с Disaster Recovery Plan, который поможет поддерживать его в актуальном состоянии, несмотря на часто изменяемые внешние условия.
Встречаемся в Москве 7 и 8 апреля на профессиональной конференции по интеграции процессов разработки, тестирования и эксплуатации DevOpsConf 2025, присоединяйтесь 🖐️
✅ Программа конференции и билеты на сайте
Post #1287
696

- 👍 5
- ❤ 1