Google SRE разбирает паттерн, который многие команды видят, но не называют вслух. Этот паттерн — героизм. Инженер закрывает своим разрыв между обещаниями системы и тем, что она реально умеет. Тикеты закрыты, SLO зелёный. Но только потому, что один человек работает по 12-16 часов и проверяет графики по выходным.
Знакомо?
⚪️ Очередь тикетов с SLO, который нельзя выполнить за рабочий день при таком потоке заявок
⚪️ Сервис с 99.99% доступности, который держится на ручном откате канареек и перезапуске задач до алертов
⚪️ launch process с нестабильной автоматизацией, которую держат за руку все выходные перед запуском.
Во всех трёх случаях система сломана. Просто это не видно, пока герой на месте. И выходит, что героизм убирает давление, которое должно запускать исправление в самой системе.
Похоже, команды, которые годами держат надёжность на одном инженере, просто не заметили, что система не готова работать без него.
👈 Читать статью полностью
@DevOpsKaz 😛
