TGViewer
Alaid TechThread Alaid TechThread @offensive_thread · 1.13K subscribers
Post #1509 817
Alaid TechThread Вышел ExploitBench - новый бенчмарк от Carnegie Mellon для оценки AI-агентов в эксплуатации уязвимостей. Его первый набор задач - v8-bench: 41 уязвимость в движке V8, который используется в Chrome, Edge, Node.js и Cloudflare Workers. Важно, что агент…
ExploitGym - бенчмарк для оценки способности LLM-агентов превращать известные уязвимости в рабочие эксплойты.
В наборе 898 реальных кейсов: 520 userspace C/C++ программ, 185 багов V8 и 193 Linux kernel задачи.
Агент получает исходный код, инструкции по сборке, PoV-input и контейнеризированное окружение; цель - добиться вполенения кода и прочитать флаг.
Это отличается от CTF и bug-finding benchmark’ов: здесь измеряется именно exploitability, а не способность найти подозрительный код или сгенерировать crash.
Интересный результат: Claude Mythos Preview решил 157 задач, GPT-5.5 - 120, причём часть успешных кейсов была в V8 и Linux kernel.
Mitigations вроде ASLR, stack canaries, V8 heap sandbox и KASLR сильно снижают success rate, но не обнуляют его.
Практическая ценность для AppSec - использовать такой подход для приоритизации уязвимостей по фактической эксплуатируемости, а не только по CVSS, CWE и наличию PoC.
Статью стоит прочитать, если вы занимаетесь AI-пентестом, exploitability validation, ASOC/ASPM или автоматизацией triage.

Интересные факты:

— Frontier-модели заметно отрываются от остальных: после Claude Mythos Preview, GPT-5.5 и GPT-5.4 результаты резко падают до десятков или единиц успешных exploit-кейсов.
— Kernel exploitation оказался хорошим разделителем: meaningful capability показали в основном Claude Mythos Preview и GPT-5.5.
— Агенты иногда эксплуатировали не целевую уязвимость, а находили другой путь к flag: у GPT-5.5 было 210 flag captures, но только 120 через intended bug; у Claude Mythos Preview — 226 и 157 соответственно.
— У разных моделей частично разные exploit sets: 56 целей решил только Claude Mythos Preview, 26 — только GPT-5.5, а 91 была общей; это намекает на пользу ensemble-подхода.
— Увеличение time budget помогает не всем: Claude Mythos Preview рос с 127 успешных exploit’ов за 2 часа до 204 за 6 часов, а Claude Opus 4.6 быстро выходил на плато.
— В одном примере GPT-5.4 за 71 минуту построил V8 exploit chain из 5-строчного PoV до system("/challenge/catflag"), с 229 строками exploit-кода.


https://rdi.berkeley.edu/blog/exploitgym/
  • 👍 2
More from @offensive_thread
  1. Aug 15, 2026Post #1516
  2. Aug 15, 2026Z.ai запустили OpenVuln - публичный сервис, который с помощью AI ищет уязвимости в open-so…
  3. Jun 22, 2026Data-Centric Benchmarking of Exploit Generation in LLMs: Understanding the Impact of Fine-…
  4. Jun 19, 2026Разбор угроз при использовании кодинговых ИИ-агентов (Codex, Cursor, Claude Code) от NCC G…
  5. Jun 15, 2026Появился интересный инструмент для iOS security research vphone-cli. Он позволяет запускат…
  6. Jun 9, 2026N-day становится N-hour. Claude Mythos Preview: — Firefox/SpiderMonkey: PoC для 14 из 18 с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →