TGViewer
AI Attacks AI Attacks @aiattacks · 1.01K subscribers
Post #357 278
AI‑агенты, предназначенные для поиска вредоносного кода, могут быть обмануты и сами выполнить этот код.

Институт AI Now опубликовал доказательство концепции атаки «Friendly Fire». Она работает против AI‑агентов Anthropic’s Claude Code и OpenAI’s Codex в автономном режиме — когда агенты самостоятельно одобряют свои команды. Атака использует файл README.md, который есть почти в каждом репозитории: в нём содержится призыв запустить скрипт security.sh. Скрипт незаметно запускает скрытый бинарный файл с полезной нагрузкой атакующего.

Исследователи Боян Миланов и Хейди Кхлааф протестировали два режима: «auto‑mode» в Claude Code и «auto‑review» в Codex. Агенты:
-читают README.md;
-решают, что скрипт — часть работы;
-апускают его без предупреждений;
-выполняют бинарный код атакующего на хосте.

При этом агенты не распознают угрозу — даже когда их прямо спрашивают о скрытых инструкциях в коде, они отвечают «нет». Одна и та же полезная нагрузка сработала на четырёх моделях (Sonnet 4.6, Sonnet 5, Opus 4.8 и GPT‑5.5) без изменений.

https://thehackernews.com/2026/07/friendly-fire-ai-agents-built-to-catch.html
More from @aiattacks
  1. Sep 27, 2026Post #471
  2. Sep 26, 2026ИИ-агент OpenAI получил доступ к внутренним данным портала медицинского страхования Австра…
  3. Sep 24, 2026ИИ-агенты взломали 27 компаний и украли данные 600 тысяч банковских карт Всего за 5 дней з…
  4. Sep 21, 2026Исследователи из компании Hacktron, специализирующейся на кибербезопасности, использовали…
  5. Sep 21, 2026Как выбирать проекты на гитхабе, когда все вайбкодят. Статья, конечно, слоп. Но в основном…
  6. Sep 21, 2026PentestChain — десятиэтапную автоматизированную систему тестирования на проникновение, кот…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →