TGViewer
Devops Bootcamp с Федосеевым Devops Bootcamp с Федосеевым @devopsupgrade · 5.32K subscribers
Post #270 1.53K
Пора объявлять победителя розыгрыша карьерной консультации 🏆

Прочитал все ваши ответы, долго думал, какой же выбрать. Посмеялся над историей про ключ от сервера 😅 А вот автору с отлетевшими кассами искренне сочувствую.

Консультацию проведу с автором этого детектива 👇

# Факап на работе — как я приложил прод

## Глава 1. Переселение elastic'а

Будучи ещё молодым и зелёным, и к тому же ещё уставшим, переселял sts'ку elastic'а (replicas=3) на отдельную группу нод (ну там affinity, toleration'ы).
Где-то опечатался и отвлёкся. Когда вернулся, проверил, что все pod'ы запущены. Но я же уставший -- не заметил один pod состоянии Pending.

Фактически sts'ка осталась в переходном состоянии, с двумя старыми pod'ами и одним, который не может зашедулиться. Двух работающих pod'ов было достаточно для того, чтобы elastic отвечал на запросы.

## Глава 2. Не проставленная галочка

У нас очень развесистый мониторинг, с множеством различных алертов, в том числе на состояние elastic'а и на состояние sts'ок.
Мониторинг шлёт алерты не на почту или в мессенджеры, а специальную систему с веб-интерфейсом. В этой системе можно отложить на какое-то время горящий алерт, можно ""склеивать"" несколько алертов и даже есть правила для автоматического склеивания.

И был в этой системе старый, отложенный, алерт с не проставленной галочкой ""не добавлять новые алерты"". Вот в него и приклеились те два алерта, которые должны были прийти мне.

## Глава 3. Scheduler всемогущий

Примерно через пару недель scheduler решил, что другому pod'у нужнее и сделал evict ещё одному pod'у elastic'а. Он тоже стал Elastic покраснел и перестал отвечать на запросы.

Тут то ко мне и пришли люди вместо алертов -- сходи посмотри, что там с elastic'ом.

## Глава 4. Поди разберись

В моей картине мира все три pod'а успешно переехали на новые ноды. А тут вдруг не хотят шедулиться. Что мешает?
Может диски? Нет. Диски в том кластере все облачные -- привязки к нодам нет.
Может недостаточно свободных ресурсов на нодах? Нет. Достаточно. Даже специально выгонял другие pod'ы с ноды. Точно не в ресурсах дело.
Может сам scheduler виноват? Перезапуск scheduler'а не помогает.

В общем, не разобрался я. Позвал старшего товарища. Вместе мы нашли мою опечатку в affinity.


В понедельник вам напишет менеджер проекта, чтобы обсудить детали и договориться о дате. До встречи!
  • 🔥 12
  • 👍 3
More from @devopsupgrade
  1. Oct 2, 2026Коллеги, приветствую👋 Курс «Профессия DevOps-инженер» уже стартовал🔥 В закрытом чате уже…
  2. Sep 23, 2026Вчера стартовал курс «Профессия DevOps-инженер»🔥 Из чего состоит курс: Обучение проходит…
  3. Sep 22, 2026⚡️⚡️⚡️⚡️⚡️⚡️ Коллеги, приветствую👋 🔴Бывали ли у вас такое, открываешь вакансию - а там с…
  4. Sep 21, 2026Post #1247
  5. Sep 18, 2026Коллеги, приветствую 👋 Сегодня подводим итоги розыгрыша фирменного мерча: разыгрывались 3…
  6. Sep 8, 2026🎉 Розыгрыш завершен! 🏆 Победители: 1. @WolkStt 🔍 Проверить результаты
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →