🧾 Как считать инциденты: время, пользователи или транзакции?
⏰ По времени
сервис был недоступен 30 минут → downtime = 30 минут
Нюансы:
- игнорируется масштаб
- не учитывается частичная деградация
Пример: 1% запросов падает 24 часа → downtime по времени ≈ 0
🙍♂️По пользователям
Формула: доля пользователей, столкнувшихся с ошибками
Плюсы:
- ближе к реальному UX
- учитывает частичные проблемы
Минусы:
- сложно считать
- не учитывает интенсивность использования
⛓️ По транзакциям
Формула: Отношение успешных запросов ко всем запросам
Плюсы:
- точная
- хорошо автоматизируется
- чувствительна к деградациям
Минусы:
- не различает важность операций
- может скрывать критические сбои
Главная ловушка: игнорирование частичной деградации
❓И как действовать?
Не можешь выбрать - бери всего по чуть-чуть:
🔑 Доступность (по времени)
🔑 Показатель успешности (по транзакциям)
🔑 Влияние (по пользователям)
И отдельно:
🗝 деградации (задержки, частичные сбои)
Главное❗️
не считать доступность "в вакууме", а привязывать её к реальному влиянию на пользователей и бизнес.
Коллеги SRE, что скажете?
Канал есть в MAX
Post #148
74