Стоит задача оценки достаточности мощности оборудования по CPU. Вот уже голову сломали с методикой. Когда смотреть на среднюю, когда на p99 и p90. Пробовали коэффициент вариации(не более 5%) и что-то никуда не пришли пока…🙁
Я касался этой темы в посте о среднем (https://t.me/troubleperf/110). Основная мысль в том, что начинать нужно с постановки проблемы, и держа ее в голове, искать решение (подходящую метрику).
«Достаточность CPU» редко бывает самоцелью, скорее нас больше интересует справляется ли система со своей прямой обязанностью:
* бекап данных заданного объема должен успеть за X (throughput)
* обработка транзакции должна уложиться в Y (latency)
Отсюда и метрики, за которыми хотим следить:
* для первой задачи подойдет среднее над
bytes/s (не над CPU!)* для второй
p95/p99 над длительностью обработки.И уже через их призму, мы можем смотреть на утилизацию CPU, если нужно понять отчего не пролазим в свои SLO.
Это если вдруг считаем, что виноват именно CPU (читаем про активный бенчмаркинг тут https://t.me/troubleperf/99).
———
Если интересно, не избыточно ли у нас мощностей, то и тут меряем запас по главной метрике (
p99/ bytes/s): насколько она далеко от порога SLO.И в зависимости от нужного запаса либо срезаем, либо добавляем ресурсы.