🔄 Всё, что вы забыли обновить, будет использовано против стабильности
Когда сервисов много, метрики, дашборды и алерты должны меняться вместе с системой. Иначе это очень быстро превращается в проблему доверия к данным.
В новой статье, Вячеслав Литкович, руководитель группы SRE-инженеров, рассказывает, как мы выстраивали SLO-подход в большой продуктовой инфраструктуре.
Поговорим про:
📌 первые SLI и дашборды
📌 error budget и почему он не всегда удобен в ежедневной работе
📌 бизнес-процессы, которые нельзя описать одной метрикой
📌 странные кейсы с Kafka, inbox/outbox и низким трафиком
📌 автогенерацию Grafana-дашбордов
📌 декларативные индикаторы и эскалации как код
🏃 Читайте на Хабре!
Post #1438
2.94K

- 🔥 15
- ❤🔥 11
- 👏 8
- ❤ 1