👾 Забудьте «промпт-инъекции». Это просто социальная инженерия против ИИ-агентов.
Обнаружить промпт-инъекции не проще, чем распознать лжеца на совещании или выявить грамотно составленное BEC-письмо во входящих у руководителя. Всё больше исследований показывает, что современные передовые модели и их защитные механизмы нередко обходятся теми же приёмами, которыми преступники многие века манипулируют людьми. Злоумышленники обходят продвинутые «гардрейлы», фабрикуя убедительные предлоги для тех или иных действий, создавая видимость авторитета, и тому подобное.
В недавних задокументированных случаях APT успешно вводили в заблуждение передовые ИИ-модели, выдавая себя за исследователей, выполняющих одобренную заказчиком работу по киберзащите, и разделяя задачу на безобидные фрагменты.
Психологическая манипуляция работает и против машин. Академические исследования показывают, что применение классических техник убеждения заметно повышает готовность модели нарушать собственные параметры безопасности. В реальных атаках мошенники уже используют скрытый текст на сайтах и поддельную документацию, чтобы обманывать автономных кодинг-агентов и заставлять их подтверждать мошеннические платежи на небольшие суммы. Но в отличие от усталого сотрудника, получившего фишинговое письмо в 3 часа ночи, ИИ-агента можно засыпать тысячами невидимых ложных сигналов в секунду практически без дополнительных затрат.
Более качественные классификаторы не решат эту проблему, так же, как они не смогли решить проблему целевого фишинга. Для решения нужен не только текст сообщения, но и много контекста про получателя, его работу и организацию. У классификатора этого контекста нет, и времени на глубокий анализ контекста тоже нет.
Поскольку классификация входных данных фундаментально ограничена, подход к защите смещается в сторону многоуровневых архитектур. Вместо попыток построить идеальный ИИ-файрвол, который будет перехватывать каждую манипуляцию, ИБ-командам нужно относиться к ИИ-агентам как к неопытным сотрудникам: жёстко ограничивать их системные привилегии, исходить из того, что рано или поздно их всё равно обманут, и проектировать системы и их связи так, чтобы минимизировать ущерб, когда это произойдёт.
#советы #ИИ @П2Т
Post #2317
983
- 🔥 8
- 👏 4
- 💯 3
- ❤ 1