Cobalt в 2025 году зафиксировал обвал: доля организаций, полагающихся исключительно на автоматическое AI-сканирование, рухнула на 20 процентных пунктов. Доверие схлопнулось до однозначных цифр. И это не луддизм — это рациональная реакция рынка на конкретные провалы.
🔎Вендоры обещали точность пентестера при скорости автоматического сканера. На практике всё упёрлось в старую проблему DAST/SAST: инструмент работает с паттернами и не понимает контекст — сетевую топологию, компенсирующие контроли, бизнес-логику. Красивая обёртка, внутри — тот же движок.
Цифры говорят сами за себя: уровень ложных срабатываний автоматических сканеров стабильно держится в диапазоне 30–60%. Каждый второй алерт — мусор. Откуда шум? Например, RHEL и Ubuntu LTS бэкпортируют фиксы без смены номера версии. Сканер видит
OpenSSL 1.1.1k, флагует CVE, закрытые месяцы назад. Команда проверяет, подтверждает патч, закрывает тикет. Умножьте на десятки таких находок — и день улетает в никуда.Или классика: сканер находит SQL injection в форме, но WAF с virtual patching блокирует инъекции. Уязвимость в коде формально есть, эксплуатируемость — ноль.
🎇Самое интересное — AI-агенты сами уязвимы. Исследователи из George Mason University показали фреймворк Mantis: защитник выставляет decoy-FTP с anonymous-входом и прячет в выводе сервера prompt injection через ANSI-escape-последовательности. Невидимые в терминале, но попадающие в контекстное окно агента. Результат? Reverse shell открывается на машине атакующего. Эффективность — свыше 95%. Живой пентестер обойдёт подозрительно открытый FTP из чистого скепсиса. Агент не различает данные и инструкции — это архитектурное свойство, а не баг.
Но списывать технологию рано. Vulnhuntr от Protect AI автономно нашёл подтверждённые уязвимости в крупных open-source проектах: stored XSS в ComfyUI, RCE в RagFlow. Стоимость — около $200 токенов Claude API. Правда, большинство находок оказалось невалидным, а два запуска на одном проекте давали разные результаты.
📌Вывод прост: AI в пентесте работает не как замена, а как ассистент. Вот где он реально экономит часы:
• Триаж и приоритизация — разгребать сотни алертов вручную бессмысленно
• Генерация гипотез — подсказать вектор, который пентестер проверит
• Рутинная разведка — сбор и структурирование данных перед ручной работой
По данным SANS, у организаций с высоким уровнем ложных срабатываний MTTR реальных уязвимостей на 40% дольше. Шум убивает не бюджет — он убивает внимание. Когда инженер трижды бросает задачу ради «критической» пустышки, он начинает игнорировать security-тикеты. И через эту рациональную реакцию ложные срабатывания создают реальные бреши.
Полный разбор с конкретными CVE, кейсами и рекомендациями по выстраиванию ML-пайплайна триажа — в статье на форуме.
https://codeby.net/threads/ai-v-penteste-pochemu-9-doveriya-eto-normal-no.95722/
