LLM-агенты умеют искать и эксплуатировать мисконфиги в Kubernetes и облаках, говорят уже все. А вот как честно измерить, насколько хорошо они это делают, — вопрос куда более скучный и куда более важный.Попытка ответа —
CNAB, Cloud-Native Autonomous-attack Benchmark: полностью офлайновый детерминированный бенчмарк для оценки агентов на задачах chaining'а мисконфигураций (и на защите от них). Идея простая: любой может развернуть у себя ту же среду одной командой, подключить свою модель/своего агента (Claude, OpenAI, Gemini или локальные через LM Studio) и получить сравнимые цифры.Внутри —
16 сценариев по Kubernetes (RBAC, NetworkPolicy), serverless (Lambda) и облачному IAM (AWS/Azure/GCP): от plaintext-кредов и IMDS/SSRF до оверпермишенов, с таксономией «фаза × домен × тип мисконфига» и уровнями сложности L1–L4. Проект совсем свежий и пока безвестный, но направление правильное: рынок «агентных пентестеров» растет быстрее, чем способность заказчика проверить их маркетинговые заявления. И обратите внимание, что тут же встроена оценка синтеза защит — то есть бенчмарк одинаково полезен и тем, кто атакует, и тем, кто потом закрывает дыры =)