Как сократить задержку обработки сигналов об инцидентах
В старой системе Atlassian путь от события до метрики занимал больше 40 секунд. После этого детекторам требовалось ещё накопить данные для анализа. Общая очередь также создавала зависимость от нагрузки других потребителей.
Команда перестроила обработку на выделенный Kafka topic и Flink-задание в Kubernetes. События фильтруются заранее, метрики отправляются через OpenTelemetry, а семидневное хранение в Kafka позволяет повторно обработать данные. При replay записи должны оставаться идемпотентными.
Важная находка: недоступный сервис может перестать присылать события. Если искать только ошибки, полное исчезновение трафика будет выглядеть как отсутствие проблем.
Разбор архитектуры показывает, как команда сократила задержку доставки метрик до менее десяти секунд и учитывала пропавшие сигналы.
Post #8014
259