Мне в мониторинг вместе с высоким LA сразу упало уведомление о недоступности NFS сервера, поэтому я сразу знал, в чём проблема. LLM предлагали посмотреть:
▪️в
top на iowait (он не вырос), ▪️в
vmstat 1 на столбец b, который показывает количество процессов, заблокированных в ожидании ввода-вывода (был 1 процесс, что не привлекает внимание)▪️в
ps -eo pid,stat,wchan,cmd | grep '^D' найти процессы в состоянии D (их не было)Ну и некоторые другие вещи. На самом деле я не смог найти какой-то конкретной метрики, которая бы указала на проблемы с примонтированным диском, кроме явной проверки доступности этого диска через тот же
findmnt, df или банальную попытку обратиться к этому диску. Все эти операции зависают. Ну и в системном журнале тоже была информация о недоступности диска:# dmesg -T | grep -iE "blocked|hung_task|nfs" | tail -n 10[Mon Oct 5 12:16:39 2026] nfs: server 192.168.137.51 not responding, still tryingДля меня осталось неясным, почему в этой истории не вырос iowait. На картинке снизу скриншот мониторинга с метриками CPU и LA. Явно видно, что LA сильно вырос, а метрики процессора все на месте.
С метрикой iowait много нюансов. Будьте с ней аккуратны. Я уже приводил пример тестов, когда iowait может показывать низкие или почти нулевые значения при жёсткой нагрузке на дисковую подсистему, которую с трудом переваривает сервер. Это связано с особенностью подсчёта этой метрики. По ссылке выше есть объяснение. Рекомендую внимательно ознакомиться для общего образования. Как показал мой случай, ИИшки не раскурили эту проблему.
Я лично уже давно привык смотреть сразу
top или htop и если там нет чего-то явно жрущего процессор, то сразу начинаю проверять диски.#linux #perfomance

