Когда у тебя сотни микросервисов, жить становится… интересно. Одни ведут себя тихо, другие устраивают танцы с бубнами. Для Dodo IS такие порядки непозволительны: система работает круглосуточно, в двух облаках, более чем в 25 странах и почти во всех часовых поясах.
И вот однажды в племени появился он — SLO'н. Большой и требовательный.
Мы поселили его в центре инженерной жизни и собрали под него отдельный инструмент — SLO Watcher. Теперь он помогает нам держать микросервисы в тонусе:
Статья полезна тем, кто хочет реально выстроить культуру надёжности, чтобы и инженеры, и продакты, и менеджмент понимали, что значит «система работает хорошо». Если у вас есть хоть сколько-нибудь сложная и распределённая система — микросервисы, облака, множество точек входа — наша история наглядно расскажет, как можно «упорядочить хаос» метрик, алертов и тревог.
SLO — это инструмент, который при вдумчивом подходе помогает всей команде говорить на одном языке: «надежность». И когда этот инструмент выстроен правильно, он действительно превращает хаотичную, шумную систему мониторинга в «пульс», по которому можно управлять качеством, приоритетами и развитием.
Александр Попов, Engineering Manager в Dodo Engineering
Полный гайд по приручению уже на Хабре
