TGViewer
Путь SRE Путь SRE @sre_community · 1.91K subscribers
Post #310 1.35K
Golden signals SRE: зачем и что мониторить

Привет, друзья! Сегодня поговорим про золотой стандарт мониторинга в SRE - Golden signals. Это четыре основные метрики, на которых строится практически вся современная наблюдаемость систем. Вот что они значат и как их реально замерять:

1️⃣ Traffic (трафик)

Traffic показывает, какой объём запросов поступает к системе. Это основной показатель нагрузки и «живости» сервиса: если внезапно стало слишком мало или слишком много запросов — это повод для внимания.

Примеры метрик:

🔹RPS (requests per second): сколько запросов в секунду приходит на сервис или датасентр.
🔹Data in/out per minute: объём входящего/исходящего трафика в минуту, например, MB/minute.


2️⃣ Errors (ошибки)

Errors — это процент или абсолютное количество неудачных запросов (failures). Ошибки бывают разного уровня: сетевые, логические, таймауты, исключения. Рост ошибок — явный сигнал инцидента или деградации.

Примеры метрик:

🔹
Error rate: доля запросов, завершившихся ошибками (например, 4xx, 5xx HTTP).
🔹
Timeout count: количество таймаутов или фейловых транзакций за промежуток времени.


3️⃣ Latency (задержка)

Latency отражает, как быстро система отвечает на пользовательский или внутренний запрос. Сюда входят network latency, время обработки, тайминг на всех слоях сервиса. Высокая задержка критична для пользовательского опыта.

Примеры метрик:

🔹
p95 latency: 95-й перцентиль времени ответа, характеризует worst‑case пользовательский опыт.
🔹
Average response time: среднее время ответа системы на типовой запрос.


4️⃣ Saturation (насыщенность)

Saturation это про то, насколько система близка к пределу своих ресурсов: CPU, память, очередь, storage. Это раннее предупреждение, что сервису не хватает мощности и скоро возможны сбои.

Примеры метрик:

🔹
CPU utilization: процент занятого процессора на инстансе или датацентре.
🔹
Queue length: длина очереди задач или сообщений для обработки.


Ориентируясь на эти метрики, можно построить надёжную систему алертирования и реально контролировать стабильность продакшена 👀 Всё остальное — для детализации и расследований.

У вас тоже эти сигналы на первом экране мониторинга или еще нет?
  • 👍 9
  • ❤ 4
  • 💯 1
More from @sre_community
  1. Sep 17, 2026Четыре алерта почти подряд. Один сервис отдаёт 500, latency поползла вверх, в чате уже спр…
  2. Sep 7, 2026В сентябре у нас стартует SRE-интенсив. Да, сегодня прямо рекламный пост 🙂 21 сентября у…
  3. Sep 4, 2026Давайте сегодня не мы вам кейс, а вы нам 🙂 Наверняка у каждого, кто дежурил или настраива…
  4. Sep 2, 2026Итак, backend отвечал 200 OK. А оплатить всё равно было нельзя. Закрываем нашу смоделирова…
  5. Aug 31, 2026Post #370
  6. Aug 31, 2026В прошлый раз дашборд говорил, что всё хорошо, а пользователи были другого мнения. Докидыв…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →