Один из подписчиков поделился историей:
В субботу ночью пошёл шквал 5xx — API легло из-за утечки соединений в пуле. PagerDuty сработал, но дежурный был без ноутбука, только с телефоном. В итоге баг нашли только через 40 минут, а бизнес узнал об этом из Twitter.
После этого команда полностью пересмотрела on-call:
— каждому выдали «дежурные ноутбуки» с VPN и доступами;
— прописали runbook для типовых сценариев;
— сделали эскалацию на второго инженера через 10 минут тишины;
— завели шаблон post-mortem и ротацию on-call раз в неделю.
💬 Вопрос к вам:
Как у вас устроено дежурство? Оплата, эскалации, время реакции — что реально работает, а что оказалось лишним?
🐸 Библиотека хакера
#ask_the_community
