Разговор про SRE начнём с классических вещей.
В книжке Гугла Site Reliability Engineering, которую вы можете найти в комментариях к посту про литературу и книги в нашем канале, описывается четыре золотых сигнала (SRE) — это четыре ключевые метрики мониторинга, которые помогают оценивать производительность и доступность систем, а также быстро реагировать на возможные проблемы.
Эти сигналы — задержка, трафик, ошибки и насыщенность — помогают специалистам SRE и DevOps-командам сфокусироваться на аспектах системы, которые оказывают наибольшее влияние на пользовательский опыт и стабильность. Рассмотрим подробнее каждый из сигналов:
Задержка (Latency)
Задержка — это время, которое требуется системе для обработки запроса. Другими словами, это время между запросом и ответом. Это могут быть как пользовательские запросы так и запросы внутри системы к какому-то компоненту. В SRE важно разделять понятия общей задержки и задержки при ошибках. Например, если запрос завершился сбоем, важно измерить, сколько времени заняло ожидание до ошибки, так как высокая задержка, даже при ошибочных запросах, негативно влияет на пользователя.
Почему это важно: Задержка показывает, насколько быстро система обрабатывает запросы, и позволяет выявить проблемы с производительностью. Также величина задержки определяет количество вычислительных ресурсов, требуемых для стабильной работы прода - чем больше времени выполняется операция, тем больше железа требуется для параллельного выполнения операций. Высокая задержка может свидетельствовать о необходимости оптимизации кода, улучшения инфраструктуры или масштабирования ресурсов.
Примеры: Среднее время ответа для API-запросов, задержка при загрузке страниц, время отклика базы данных.
Следующий золотой сигнал: Трафик (Throughput)
#SRE #полезныематериалы @downtime_bar
Post #112
536

- 🔥 3
- 👨💻 3
- 🙈 1
- 🆒 1