Представим ситуацию, сервер начинает тормозить, мониторинг краснеет, а пользователи уже бегут к телефону или генерируют инциденты. На этот случай и написан чеклист, что проверять в первую очередь.
1️⃣ CPU: кто жрет процессор
uptime
Смотрим:
Load Average
сравниваем с количеством CPU (nproc)
Если load > количества ядер - это означает, что проблема есть.
Детализация:
top
Смотрим:
%CPU
us / sy / wa
процессы в топе
Если высокий wa, то проблема в IO.
2️⃣ IO: не уперлись ли в диск
iostat -xz 1 3
Смотрим:
%util
await
svctm
Если %util ≈ 100% - диск забит.
Быстрое упрощение:
iotop
Кто активно пишет/читает.
3️⃣ Память: нет ли OOM
free -h
Проверяем:
свободная память
swap
И сразу:
dmesg | grep -i oom
Если есть OOM Killer, то причина найдена.
4️⃣ Сеть: не уперлись ли в соединения
ss -s
Смотрим:
ESTAB
TIME-WAIT
orphaned sockets
И:
iftop
Кто льет трафик.
5️⃣ Процессы: нет ли runaway
ps aux --sort=-%cpu | head
ps aux --sort=-%mem | head
Смотрим:
неожиданные процессы
бесконечные воркеры
6️⃣ Быстрый общий снимок
top -b -n1 | head -20
Будет полезно для фиксации состояния.
BashTex 📱 #bash #utils