Что показали OpenAI в анонсе Codex Security?
После маркетинговой воды первой полезной информацией замечаем метрики:
...scans on the same repositories over time show increasing precision, in one case cutting noise by 84% since initial rollout. We’ve reduced the rate of findings with over-reported severity by more than 90%, and false positive rates on detections have fallen by more than 50% across all repositories.
Поскольку агент и ищет, и триажит уязвимости, то говорят о значительном прогрессе относительно первых версий в части снижения ложных сработок на 84%, но не говорят с какой базы этот показатель снижен (сомнительно).
Снижение на 90% доли файндингов с завышенной оценкой в целом тоже метрика относительная, статистики по заниженным оценкам они не дают, хотя этот показатель кажется критичнее.
Снижение числа ложных срабатываний - единственная понятная метрика конечному пользователю, поскольку триаж TP/FP занимает значительную часть работы аппсека.
Идем дальше. В отличие от антропиков, релиз раздадут в речение нескольких дней на все подписки ChatGPT Enterprise, Business, и Edu. Мне кажется, что дело не в зрелости проекта, а в гонке за клиентов, ведь чем больше охват, тем больше данных для улучшения в дальнейшем.
Заметно отличается от антропиков и скоуп возможностей (выделил жирным):
1.
Создание модели угроз приложения. С одной стороны это вызывает уважение, потому что именно с этого и должна начинаться безопасная разработка по всем учебникам. По факту - это аналог
AGENT.md, который собирается при первом проходе по репозиторию.
2.
Приоретизация уязвимостей по модели угроз. На демо показали, что в случае удачной проверки файндинга прикладывается архив с PoC.
3. Заявляют, что надежность системы повышается при доступе к развернутому проекту (что справедливо и для классических sast/dast).
4. Предлагают автофикс с созданием PR в github
5.
Учатся на фидбеке пользователей. Если пользователь меняет критичность уязвимости, агент добавляет изменения в
AGENT.md документ модели угроз.
Одной из ключевых мыслей, которую я подметил, является фокус на триаже и отборе полезных сработок вместо генерации большого количества шумных файндингов:
Rather than generating large volumes of speculative findings, we are building a system that prioritizes high-confidence issues that maintainers can act on quickly.
Нытье, как обычно, в комментах:)