В многоарендном Kubernetes-кластере один «шумный сосед» периодически выедает CPU/IO и ломает SLA остальных сервисов. Как обеспечить изоляцию и предсказуемое качество без избыточного оверпровижининга?
Дать критичным сервисам QoS Guaranteed (requests=limits), ввести LimitRange/ResourceQuota по namespace, приоритизацию через PriorityClass и развести пулы нод с taints/tolerations. Включить HPA/VPA + Cluster Autoscaler, задать корректные PDB и параметры RollingUpdate. Для «шумного» сервиса — жёсткие лимиты (CPU CFS), контроль IO/ephemeral-storage и при необходимости — вынести в отдельный node pool.
Библиотека собеса по DevOps
Post #799
757