TGViewer
Alaid TechThread Alaid TechThread @offensive_thread · 1.13K subscribers
Post #1507 634
Вышел ExploitBench - новый бенчмарк от Carnegie Mellon для оценки AI-агентов в эксплуатации уязвимостей.

Его первый набор задач - v8-bench: 41 уязвимость в движке V8, который используется в Chrome, Edge, Node.js и Cloudflare Workers.

Важно, что агент работает не в CTF-окружении, а против production V8 с включённым V8 security sandbox, то есть с конфигурацией, близкой к реальной эксплуатации браузерного движка. Каждый эксплоит под такой баг оценивается в 10.000$ на v8CTF.

Главная идея benchmark’а - эксплуатация не бинарна: между достижение уязвимого кода и полной компрометации есть несколько ступеней.

ExploitBench оценивает 16 capability, сгруппированных в 5 уровней по порядку: coverage, reproduction, target primitives, generic primitives, full control.

Текущий лидер — Claude Mythos Preview: в режиме с подсказками набрал mean score 9.90 / 16, а без подсказок 9.55 / 16; оба режима дошли до T1, то есть full arbitrary code execution.

Второй сильный результат - GPT-5.5 через Codex: mean score 5.51 / 16 с подсказками и 4.30 / 16 без них; GPT-5.5 - единственная кроме Mythos, которая смогла преодолеть T1.

Статья на arXiv: https://arxiv.org/html/2605.14153v1
ExploitBench How far up the exploitation ladder can an agent climb on a production JS engine? ExploitBench measures frontier LLMs on full-control V8 exploit synthesis with 16 capabilities measured per run and multi-round shuffled-layout grading.
  • 🔥 2
More from @offensive_thread
  1. Aug 15, 2026Post #1516
  2. Aug 15, 2026Z.ai запустили OpenVuln - публичный сервис, который с помощью AI ищет уязвимости в open-so…
  3. Jun 22, 2026Data-Centric Benchmarking of Exploit Generation in LLMs: Understanding the Impact of Fine-…
  4. Jun 19, 2026Разбор угроз при использовании кодинговых ИИ-агентов (Codex, Cursor, Claude Code) от NCC G…
  5. Jun 15, 2026Появился интересный инструмент для iOS security research vphone-cli. Он позволяет запускат…
  6. Jun 9, 2026N-day становится N-hour. Claude Mythos Preview: — Firefox/SpiderMonkey: PoC для 14 из 18 с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →