Классическая ситуация: всё работало, потом в какой-то момент — тишина. Никаких изменений, никаких предупреждений.
Спойлер: кое-что всё-таки поменялось.
Первым делом ищем момент X:
# Когда система последний раз перезагружалась?
uptime
last reboot
# Что происходило в последний час?
journalctl --since "1 hour ago" | grep -i "error\|fail\|panic"
# Не убил ли OOM killer что-нибудь важное?
dmesg | grep -i "out of memory"
Задача — найти точное время потери связи и посмотреть, что случилось рядом с этим моментом.
Частые виновники
• Kernel panic — система тихо перезагрузилась, вы не заметили
• OOM killer — памяти не хватило, и он прибил NetworkManager или другой критичный процесс
• Maintenance провайдера — AWS, GCP, Azure иногда делают работы без громкого анонса. Проверьте status page
• Физика — коммутатор перезагрузили, кабель отошёл, что-то щёлкнуло в серверной
• Автоматизация — cron job или Ansible отработал по расписанию и сломал конфигурацию
Главный принцип: «само по себе» не бывает. Всегда есть триггер — нужно просто найти его в правильном месте.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека devops'a
#root_prompt