Что вы проверяете первым, когда сервис начинает отвечать медленнее?
Условная ситуация: за последние 15 минут у API-сервиса выросла p95 latency. Доля ошибок осталась на обычном уровне, но пользователи подтверждают замедление. Сервис обслуживает несколько эндпоинтов, обращается к базе данных и вызывает другие сервисы. У команды есть метрики, централизованные структурированные логи и распределённый трейсинг.
Инцидент только начался, готового сценария диагностики для этого симптома нет.
Post #37
212
