Мониторинг распределённой инфраструктуры — задача, которая не решается добавлением очередного специализированного инструмента.
Большинство ИТ-команд пришли к текущему состоянию последовательно и логично: сначала Zabbix для серверов, затем отдельный инструмент для сети, APM для приложений, ещё одна система для логов. Каждое решение принималось под конкретную задачу и было обоснованным. Результат — разрозненный стек из пяти и более систем мониторинга, ни одна из которых не отвечает на главный вопрос при инциденте: что происходит с бизнес-сервисом и в каком компоненте причина.
Проблема не в качестве отдельных инструментов. Zabbix корректно отслеживает серверные метрики, сетевая система — состояние каналов, APM — транзакции приложений. Проблема в том, что эти инструменты изолированы друг от друга и не имеют общей модели зависимостей. Когда деградация сервиса вызвана нагрузкой на базу данных, которая влияет на сеть, которая замедляет API — ни один из инструментов не покажет эту цепочку целиком. Инженер выстраивает картину вручную, переключаясь между системами в условиях активного инцидента.
По данным Dynatrace, среднее крупное предприятие использует около 10 инструментов мониторинга, обеспечивая при этом полную видимость лишь в 11% своих приложений и инфраструктуры. Это прямое следствие разрозненности, а не недостаточного числа инструментов.
Описанная проблема решается на уровне архитектуры — через зонтичный мониторинг с корреляцией сервисов. Подробности в нашей новой статье
Post #171
141

- ❤ 4
- 🔥 2