Представьте: вы просите Claude Code в Auto Mode подтянуть документацию с сайта и собрать чек-лист зависимостей. Агент послушно идёт на страницу, парсит HTML, загружает контент в контекстное окно — и вместо вашей задачи начинает выполнять инструкции, спрятанные в разметке страницы. Без единого запроса на подтверждение.
Это не теория. При неформальном тестировании четырёх агентных систем (Claude Code, Cursor, две AutoGPT-обёртки) три из четырёх попыток заканчивались тем, что агент выполнял действие, продиктованное контентом страницы, а не промптом пользователя.
🔎Почему это работает?
Всё упирается в архитектуру transformer-моделей. Контекстное окно LLM принимает токены из системного промпта, пользовательского запроса и внешних данных — и обрабатывает их единообразно. Никакого архитектурного разделения между привилегированными инструкциями и недоверенным контентом не существует. Это не баг конкретного продукта — это фундаментальное свойство всех LLM-агентов.
Auto Mode превращает эту особенность в катастрофу. В обычном режиме Claude Code спрашивает подтверждение на запись файлов, shell-команды, обращение к внешним ресурсам. Auto Mode убирает этот барьер. Агент получает доступ к файловой системе, shell, Git, API-токенам — и одна отравленная страница компрометирует весь workspace.
➡️Как выглядит kill chain:
1. Атакующий прячет инструкции на веб-странице — белый текст на белом фоне,
display:none, font-size:0 — пользователь ничего не видит2. Вы просите агента обработать эту страницу
3. Агент парсит DOM, вытягивает весь текст, включая скрытые элементы
4. LLM интерпретирует hidden-инструкцию как команду
5. В Auto Mode команда выполняется — от
printenv до curl на внешний эндпоинтUnit 42 (Palo Alto Networks) зафиксировали реальные случаи такого вектора in the wild — не PoC, а боевое применение. Среди целей: обход AI-модерации рекламы, SEO-манипуляция для фишинга, эксфильтрация данных, утечка системных промптов.
👉По данным Cisco State of AI Security 2026, 83% организаций планируют развёртывать agentic AI, но только 29% считают себя готовыми к этому с точки зрения безопасности. Выделенные средства защиты от prompt injection внедрили лишь 34,7%. Разрыв между adoption и protection — колоссальный.
Что может получить атакующий через скомпрометированный coding-агент? Backdoor в кодовой базе, API-ключи из переменных окружения, доступ к приватным репозиториям, модификацию CI/CD пайплайна. Одна страница → компрометация всей цепочки поставки ПО.
Используете coding-агенты в Auto Mode? Подробный разбор payload-техник, конкретных векторов обхода и методов защиты — в полной версии статьи.
https://codeby.net/threads/prompt-injection-ataki-na-ai-agenty-obkhod-claude-code.95424/
