По поводу uptime есть следующие моменты.
Во-первых, собственно, сам uptime. Когда считается, что сайт, продукт или сервис сломан?
Некоторые считают, что сайт лежит, если на него нельзя попасть. Подход это неправильный и вот почему.
Допустим у вас есть интернет-магазин плюшевых котят. Сам сайт у вас работает, пользователь может зайти на него, но вот незадача - он не может оформить заказ. Или ему не приходит электронное письмо с подтверждением заказа. Или, что еще хуже, заказ оформлен, деньги уплочены, а вот заказ в CRM не появился, и доставка не будет произведена.
Дабы избежать таких разборок, толковые ребята в эксплуатации указывают в SLA что является сбоем и разделают общий uptime (сайт работает) и частичный uptime (все компоненты работают).
С таким подходом реализуется мониторинг всех движущих частей, и каждая команда инженеров отвечает конкретно за свой кусок.
SLA считается соответственно для общего и частичного uptime.
Вообще наука эта очень интересная, люди до сих пор спорят между собой по теме «что понимается под «все работает».
Что же до нас, то мы дошли до такого с внедрением микросервисной архитектуры, где программа состоит из множества маленьких блоков, каждый из которых мониторится и управляется разными группами.
Post #153
169