TGViewer
Библиотека хакера | Hacking, Infosec, ИБ, информационная безопасность Библиотека хакера | Hacking, Infosec, ИБ, информационная безопасность @hackproglib · 12.7K subscribers
Post #5516 956
📌 5 способов защитить AI-агента от prompt injection

Работает только комбинация подходов: часть на уровне модели, часть — на уровне системы.

1️⃣ Spotlighting (разметка недоверенного контента)

Любой внешний текст (email, веб-страница, документ) оборачивается в <UNTRUSTED>...</UNTRUSTED>. Модель должна воспринимать его как данные, а не инструкции.


2️⃣ Instruction hierarchy (приоритет инструкций)

Системный и developer prompt всегда выше пользовательского ввода, а пользовательский — выше стороннего контента. Это снижает шанс, что внешние данные «перепишут» логику.

3️⃣ Least-privilege tools (минимальные права)

Агенту дают только те инструменты, которые реально нужны. Чем меньше возможностей — тем меньше ущерб при успешной инъекции.

4️⃣ Human-in-the-loop (подтверждение действий)

Критичные операции (письма, удаление данных, доступы) требуют явного подтверждения. Это простой, но эффективный стоп-кран.

5️⃣ Planner / Executor split (разделение ролей)

Одна модель планирует и работает с инструментами, другая читает недоверенный контент, но ничего не может выполнить. Даже если её «сломают» — дальше атака не пойдёт.


Больше можно узнать об ИИ-агента тут.

🐸 Библиотека хакера

#cheat_sheet
  • ❤ 3
  • 👍 3
  • 🥰 3
More from @hackproglib
  1. Sep 19, 2026А вы уже забрали свой подарок ко Дню программиста? К вашему профессиональному празднику Tp…
  2. Sep 15, 2026😭 Как не потратить недельный лимит AI-кодинга за три дня? Разберём на вебинаре, как трати…
  3. Sep 13, 2026🌸 Вселенная намекает: пора уже начать этот курс С 14 сентября цены в Proglib Academy выра…
  4. Sep 13, 2026📡 Wireshark: что читать, чтобы реально научиться анализу трафика Подборка актуальных стат…
  5. Sep 13, 2026🤪 Если бы можно было задать один вопрос про AI в разработке — что бы вы спросили? Как выб…
  6. Sep 3, 2026🎬 Реалистичный хакинг в кино Это один из немногих фильмов, где атака строится не на «взло…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →