AI‑агенты, предназначенные для поиска вредоносного кода, могут быть обмануты и сами выполнить этот код.
Институт AI Now опубликовал доказательство концепции атаки «Friendly Fire». Она работает против AI‑агентов Anthropic’s Claude Code и OpenAI’s Codex в автономном режиме — когда агенты самостоятельно одобряют свои команды. Атака использует файл README.md, который есть почти в каждом репозитории: в нём содержится призыв запустить скрипт security.sh. Скрипт незаметно запускает скрытый бинарный файл с полезной нагрузкой атакующего.
Исследователи Боян Миланов и Хейди Кхлааф протестировали два режима: «auto‑mode» в Claude Code и «auto‑review» в Codex. Агенты:
-читают README.md;
-решают, что скрипт — часть работы;
-апускают его без предупреждений;
-выполняют бинарный код атакующего на хосте.
При этом агенты не распознают угрозу — даже когда их прямо спрашивают о скрытых инструкциях в коде, они отвечают «нет». Одна и та же полезная нагрузка сработала на четырёх моделях (Sonnet 4.6, Sonnet 5, Opus 4.8 и GPT‑5.5) без изменений.
https://thehackernews.com/2026/07/friendly-fire-ai-agents-built-to-catch.html
Post #357
278