TGViewer
Alaid TechThread Alaid TechThread @offensive_thread · 1.13K subscribers
Post #1510 761
Berkeley предлагает оценивать AI-агентов для поиска уязвимостей не по числу найденных багов, а по покрытию классов CWE.

Ключевые метрики: критичность, эксплуатируемость, подтвержденный PoC, широта покрытия классов уязвимостей и слепые зоны.

Ценность агента в способности валидировать уязвимость. Хорошая карта покрытия показывает, где агент силен, а где пока бесполезен (например, поиск вредоносной функциональности). Одна тут стоит обратить внимание на возможную проблему в том, как формировалось выборка, что настораживает с интерпретацией.

По данным также видно, что агенты от разных организаций наиболее успешны в своей области (например, Memory-Safety уязвимости у Google и Microsoft)

https://vuln.cs.berkeley.edu
Berkeley Vulnerability Initiative Agentic Vulnerability Coverage Map A coverage map of vulnerabilities discovered by agentic systems, rebuilt daily from public CVE feeds.
  • 👍 3
More from @offensive_thread
  1. Aug 15, 2026Post #1516
  2. Aug 15, 2026Z.ai запустили OpenVuln - публичный сервис, который с помощью AI ищет уязвимости в open-so…
  3. Jun 22, 2026Data-Centric Benchmarking of Exploit Generation in LLMs: Understanding the Impact of Fine-…
  4. Jun 19, 2026Разбор угроз при использовании кодинговых ИИ-агентов (Codex, Cursor, Claude Code) от NCC G…
  5. Jun 15, 2026Появился интересный инструмент для iOS security research vphone-cli. Он позволяет запускат…
  6. Jun 9, 2026N-day становится N-hour. Claude Mythos Preview: — Firefox/SpiderMonkey: PoC для 14 из 18 с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →