Ваш клиент пишет system prompt
Можно выбрать устойчивую модель, продумать системный промпт и настроить иерархию инструкций.
А потом позволить пользователю самостоятельно назначить своим сообщениям роль system.
Именно такую проблему обнаружили авторы исследования When AI Meets the Web, принятого на IEEE S&P 2026.
Они изучили 17 сторонних плагинов для AI-чатботов, развёрнутых более чем на 10 000 сайтов.
У 8 плагинов, которые использовались примерно на 8 000 сайтов, история диалога отправлялась из браузера внутри POST-запроса без проверки её подлинности и целостности.
Пользователь мог изменить историю, добавить сообщение от имени assistant или даже вставить собственную инструкцию с ролью system.
USER → SYSTEM
В экспериментах такая подмена повышала успешность исследованных нежелательных сценариев в 3–8 раз.
Второй путь атаки проходил через RAG.
Системы автоматического сбора контента у 15 плагинов извлекали со страниц не только контент владельца сайта, но и пользовательские отзывы и комментарии. В случайной выборке из 100 интернет-магазинов исследователи нашли 13 чатботов, которые уже получали сведения из отзывов.
Авторы не публиковали вредоносный контент на реальных сайтах, поэтому это не доказанная эксплуатация этих магазинов. Но канал для indirect prompt injection уже присутствовал:
отзыв атакующего → база знаний → контекст модели
Иерархия инструкций работает только тогда, когда приложение сохраняет границы между ролями.
Можно месяц укреплять системный промпт, а затем превратить user в system одним полем JSON.
Классический AppSec. Просто теперь с токенами.
#AIxSec #PromptInjection #RAGSecurity #AppSec #AIxSec_Research
Post #35
249

- ❤ 7
- 🔥 4
- 👍 3