Grafana Alloy вполне себе можно рассматривать полноценный центральный шлюз телеметрии для метрик, логов и трейсов. Если используете или планируете использовать Grafana Stack рассмотрите использование Alloy.
В этой статье в блоге Grafana разбирают кейс: около 17 млн метрик, до 1 ТБ логов в сутки, терабайты трейсов, десятки подов Alloy и отдельная стратегия автоскейлинга. А еще рассказали где всё начинало ломаться во время нагрузочных тестов.
Из полезного: не ставить лимит на CPU, держать высокий MinReplica, использовать GOMEMLIMIT как защиту от OOM, отдельно мониторить сам telemetry gateway и тестировать нагрузку выше ожидаемого пика.
Еще в статье немного коснулись тему автомасштабирования кластера k8s не только по CPU и памяти, но и по заполнению очередей экспортера через KEDA — то есть реагировать на обратное давление ещё до того, как поды начнут себя чувствовать так себе.
📌 Подробнее: https://grafana.com/blog/how-to-scale-alloy-as-a-central-telemetry-gateway-capacity-planning-load-testing-and-production-lessons/
MemOps🤨
