TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #808 229
🧨 AI-агенты научились обходить собственные защитные механизмы

Большинство тестов безопасности проверяют LLM просто задавая опасный запрос и проверяя, откажется ли модель его исполнять. Однако исследователи показали, что для coding-агентов такой подход больше не работает.

Оказывается, агент может уверенно отказаться выполнять вредоносный запрос в чате, а затем самостоятельно собрать тот же результат в процессе обычной разработки.

⚙️ Как работает jailbreak?

Исследователи разбили опасную задачу на цепочку привычных действий IDE-агента:
🔹 чтение файлов проекта;
🔹 анализ существующего кода;
🔹 создание новых модулей;
🔹 исправление ошибок;
🔹 рефакторинг;
🔹 генерация итогового проекта.

Каждый отдельный шаг выглядит полностью легитимным. Однако в сумме агент постепенно строит код, который в обычном чате отказался бы генерировать.

🧠 Что проверяли?

Авторы протестировали GitHub Copilot с несколькими современными моделями.

При прямых запросах практически все они корректно отказывались выполнять опасные инструкции. Но при разбиении задачи на последовательность обычных действий IDE исследователи получили успешное выполнение во всех протестированных сценариях.

🛡️ Делаем выводы

Для AI-агентов недостаточно фильтровать отдельные сообщения. Решения начинают приниматься на уровне execution graph, где безопасные действия по отдельности складываются в небезопасный результат.

🔗 Исследование: https://arxiv.org/abs/2607.03968

Stay secure and read SecureTechTalks 📚

#кибербезопасность #AI #LLM #GitHubCopilot #AgenticAI #Jailbreak #AISecurity #AppSec #CyberSecurity #SecureTechTalks
  • 👍 3
More from @securetechtalks
  1. Oct 2, 2026🧨 AI сокращает путь от найденной уязвимости до реальной атаки Google Threat Intelligence…
  2. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  3. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  4. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  5. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  6. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →