TGViewer
maxigacy (AI) Security maxigacy (AI) Security @aixsec · 392 subscribers
Post #35 249
Ваш клиент пишет system prompt

Можно выбрать устойчивую модель, продумать системный промпт и настроить иерархию инструкций.

А потом позволить пользователю самостоятельно назначить своим сообщениям роль system.

Именно такую проблему обнаружили авторы исследования When AI Meets the Web, принятого на IEEE S&P 2026.

Они изучили 17 сторонних плагинов для AI-чатботов, развёрнутых более чем на 10 000 сайтов.

У 8 плагинов, которые использовались примерно на 8 000 сайтов, история диалога отправлялась из браузера внутри POST-запроса без проверки её подлинности и целостности.

Пользователь мог изменить историю, добавить сообщение от имени assistant или даже вставить собственную инструкцию с ролью system.

USER → SYSTEM

В экспериментах такая подмена повышала успешность исследованных нежелательных сценариев в 3–8 раз.

Второй путь атаки проходил через RAG.

Системы автоматического сбора контента у 15 плагинов извлекали со страниц не только контент владельца сайта, но и пользовательские отзывы и комментарии. В случайной выборке из 100 интернет-магазинов исследователи нашли 13 чатботов, которые уже получали сведения из отзывов.

Авторы не публиковали вредоносный контент на реальных сайтах, поэтому это не доказанная эксплуатация этих магазинов. Но канал для indirect prompt injection уже присутствовал:

отзыв атакующего → база знаний → контекст модели

Иерархия инструкций работает только тогда, когда приложение сохраняет границы между ролями.

Можно месяц укреплять системный промпт, а затем превратить user в system одним полем JSON.

Классический AppSec. Просто теперь с токенами.

#AIxSec #PromptInjection #RAGSecurity #AppSec #AIxSec_Research
  • ❤ 7
  • 🔥 4
  • 👍 3
More from @aixsec
  1. Sep 25, 2026🤖 ИИ уволит аналитиков SOC? На OFFZONE поговорил с Ильёй Крестиничевым из SOC Яндекса о н…
  2. Sep 23, 2026Подключил MCP. Получил SSRF Когда обсуждают безопасность MCP, обычно вспоминают prompt inj…
  3. Sep 21, 2026⚡️ Яндекс обучил собственную LLM с нуля и открыл её веса 19 сентября был на Practical ML C…
  4. Sep 19, 2026Сегодня на Practical ML Conf от Яндекса 👨‍💻 На фото разбирают, как готовят ответы для до…
  5. Sep 18, 2026Уйти из кибербеза пасти гусей 🪿 Даже в театре нашёл с кем поговорить про AI Security 😅 З…
  6. Sep 17, 2026Firewall для tool calls Разрешить агенту инструмент delete_file ещё не значит разрешить уд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →