Ресурсы: куда смотрим
Когда мы говорим о ресурсах — будь то дисковое пространство, сеть или скейлинг — важно понимать, где находятся наши лимиты и как с ними работать. Это не только про мониторинг, но и про стратегическое планирование, про то, чтобы знать заранее, где твои пределы.
- Алерты на disk space — всегда надо держать под контролем свободное место на дисках. Недостаток места — это не только ошибка, но и паника, когда система откажется работать. Подключите алерты, не дожидайтесь сбоя.
- Алерты на потребление сети — внезапно, проверяйте лимиты пропускной способности. Когда приложения исчерпают сетевые карточки прыгать уже будет поздно, а архитектура сети может не позволять быстро отмасштабироваться.
- Алерты на скейлинг — здесь важно понимать, как растёт нагрузка с ростом трафика. Вы должны точно знать, когда нагрузка на сервис возрастает и где можно добавить ресурсы. Регулярное тестирование нагрузки со вдумчивым анализом может защитить вас от нежданчиков.
- CPU, RAM — очевидно, нужно мониторить. Когда поды на пределе — это, конечно, не повод бить в набат, но явно не плановая ситуация. Стремитесь к тому, чтобы система работала на запасе, а не на грани.
- Oversell ресурсов — если вы пересчитываете проценты ресурсов и на бумаге "всё нормально", но софт всё равно тормозит — помните, oversell (продажа большего количества ресурсов, чем реально есть) может выливаться в проблемы. Уточните у своего слоя инфраструктуры — насколько они делают oversell по процам.
Это не полный список, но эти пункты писаны кровью.
Я что-то забыл? Конечно!
Напишите в комментах, что видите вы.
Post #584
1.98K
- 👍 7