При проверке RHEL 10.2 команда Red Hat обнаружила падение пропускной способности CockroachDB до 93% в отдельных тестах на multi-NUMA машинах. При этом CPU могли почти простаивать, хотя работающие потоки ожидали выполнения.
Расследование включало повторные запуски, сравнение ядер,
vmstat, schedstat и проверку NUMA-размещения. Круг подозреваемых сузили до изменений планировщика, а затем — функции NI_RANDOM.В техническом разборе показаны условия воспроизведения и способ устранить деградацию без перезагрузки.
Для эксплуатации полезен сам порядок проверки: если после обновления throughput падает при свободных CPU, изучите очередь runnable-потоков и время ожидания планировщика. Сравнивайте несколько прогонов: в этом случае система переключалась между нормальным и деградировавшим состояниями.