TGViewer
DevOps для ДевоПсов DevOps для ДевоПсов @devo_pes · 3.22K subscribers
Post #7952 438
Алерт по задержкам пришёл, а дашборды деплоймента зелёные: чего не хватает вашей телеметрии

Latency вырос, rollout выглядит здоровым, поды живы, CPU в норме. Причина ниже: запрос пользователя проходит ingress, сервисы, очереди, storage и фоновых воркеров, и деградация приходит с любого участка или из шумного retry-цикла.

Мониторинг отвечает только на вопросы, заданные заранее: CPU выше порога, память растёт, ошибки участились. Инцидент, которого вы не предвидели, он не опишет.

CNCF в блоге описывает наблюдаемость шире: инструментирование, сбор, обработка, хранение, запросы и корреляция метрик, логов, трейсов и профилей. Задача — по внешним сигналам восстановить, что происходило внутри.

Что делать: возьмите последний инцидент и проверьте, пройдёте ли по нему от ingress до воркера одним trace id. Нет — чинить надо инструментирование, а не добавлять ещё дашборд.
More from @devo_pes
  1. Sep 20, 2026ACME отработал с кодом 0, а пользователи всё ещё получают старый сертификат Cron обновил с…
  2. Sep 20, 2026Зелёный CI не ловит деградацию под трафиком, зато её ловит канарейка с автооткатом Функцио…
  3. Sep 20, 2026Что проверить перед запуском приложения в Kubernetes Pod может запуститься, а обновление и…
  4. Sep 19, 2026Как выбрать инструменты для анализа производительности Linux При инциденте на Linux-хосте…
  5. Sep 19, 2026OpenTelemetry бесплатен ровно до дня, когда вы начали его эксплуатировать Стандарт снял пр…
  6. Sep 19, 2026Как измерить и сократить toil в эксплуатации Google SRE определяет toil как поток повторяю…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →