Мониторинг важен. Рабочий мониторинг ещё важнее
Нередко систему мониторинга проекта делают в конце и кое-как. Страшно, что "кое-как" делают мониторинг даже важных вещей.
Кто-то ошибся в настройке турбины, кто-то вовремя не убрал деревья под ЛЭП, чья-то система генерации аварийных оповещений выключается (а нет оповещений — нет проблем, ведь так?), кто-то пишет код с race condition, кто-то перезапускает сервера и не проверяет их работоспособность после ребута. Это и многое другое — в статье Блэкаут в США 2003: как два сервера обвалили энергосистему, где расследуется случай 2003 года. В результате стечения большого количества ошибок были аварийно остановлены почти 300 электростанций и свыше 50 млн человек остались без электроэнергии.
Правильно сконфигурированная система логгирования позволяет расследовать инциденты. Настроенная система мониторинга оповещениями предупредит вас об опасных ситуациях, например, близкой к критической нагрузке по процессору, оперативной или дисковой памяти.
#skills
Post #142
1.06K