Коллеги, приветствую 👋🏻
Как ваши дела? Я на этой неделе в командировке с командой, где мы и обсуждаем рабочие встречи и просто вспоминаем кто как выглядит)
⏩Захотелось вот что обсудить. Как вы подходите к важным работам на проде и какие случаи бывали?
Я начал замечать, что часто самые важные работы проводятся в нерабочее время, которое является для системы менее нагруженным и безопасным с точки зрения недоступности.
И вот даже если эти работы заранее планировать, то все равно что-то случается: то во время работ пропадает доступ, то изменения пересекаются с другими завершающимися работами. Сюда же сразу вспоминаются праздники и рождение детей 😁
Мне всегда нравились эти ответственные моменты, они объединяют усилия команд.
⏩Расскажу про случай, когда мы выполняли обновление системы, запланированное заранее на поздний вечер.
Разделили работы на всех и сделали все по плану, кроме одного пункта. В нем было указано залить два раза один и тот же конфиг. Очевидно, что хватит и одного раза. Так подумали и мы, завершив все работы. И, конечно же, начались те самые сложно уловимые проблемы, которые не заметны сразу. В итоге, сэкономив на повторной заливке конфига – мы очень долго все отлавливали и восстанавливали, хотя в позднее время сил уже нет.
В то время не было никакого DevOps-процесса, и конечно, конфиг грузился просто как огромный файл, человеческий фактор был очень важен. А повторная загрузка на самом деле позволяла обойти багу с тем, что загрузка конфига отваливаясь по таймауту, и подрезала конфиг...
Поделитесь, у вас было нечто подобное?⬇️
Post #1154
1.53K