Долгое время безопасники отмахивались от нейросетей, мол, баги они находят неплохо, но вот написать рабочий, боевой эксплойт — кишка тонка. Что ж, расчехляйте шапочки из фольги 😁
Свежее исследование от толпы умников из Беркли, OpenAI и Anthropic доказало обратное. На новом бенчмарке ExploitGym флагманские модели вроде Claude Mythos и GPT-5.5 начали уверенно клепать эксплойты, способные на реальное удаленное выполнение кода.
Цифры заставляют нервно сглотнуть. Из почти 900 реальных уязвимостей Mythos за пару часов успешно пробил 157, а GPT-5.5 — 120. Причем их не остановили даже стандартные защиты вроде ASLR или песочницы V8. Но больше всего напрягает то, как эти цифровые агенты начали импровизировать.
Натравливаешь бота на конкретную дыру в CTF-задании, а он уходит не по скрипту и ломает систему вообще через другое, не задокументированное место. Буквально: "я нашел способ получше". ИИ начал проявлять пугающую креативность там, где от него ждали тупого следования инструкции.
Естественно, все эти тесты гоняли с отключенными фильтрами безопасности. В ванильном режиме GPT-5.5 врубает моралфага и отказывается писать зловредный код в 88% случаев. Вот только любой школьник с Reddit уже знает пару десятков промптов, чтобы джейлбрейкнуть эти ограничения.
🥸 Новости IT: 📱 Telegram | 📱 ВК | 📲 MAX
Post #11325
938

- 👍 4
- ❤ 1