В результате такой атаки на LLM-приложение может реализовываться несколько видов атак:
1. Атаки на конфиденциальность: под воздействием инъекции чат-бот может выспрашивать необходимую информацию у пользователя, или информация может извлекаться без участия человека, например, в случае приложения-секретаря, которое может читать и отправлять почту.
2. Мошенничество: LLM очень хорошо умеют убеждать, и мошенники могут использовать это, чтобы убеждать людей переходить на фишинговые ссылки или делиться кредами и платежной информацией.
3. Распространение вредоносного кода: аналогично, LLM могут уговаривать пользователей скачивать вредоносное ПО или эксплуатировать пересылку email для их распространения.
4. Взлом: вход LLM может заставлять их использовать те или иные API, которые не должны вызываться по результатам анализа внешнего контекста. Кроме того, если LLM-приложение имеет механизм персистирования истории сообщений, то атакующий промпт может быть сохранен в истории и затем снова вызываться.
5. Манипуляция контентом: вредоносный промпт может заставить ассистента неправильно суммаризировать контент, подавлять ту или иную информацию, врать и, конечно же, незаметно вставлять рекламу.
6. Отказ в обслуживании: инъекция может вызывать нестабильность работы, мешать модели генерировать вывод или вызывать инструменты, а также заставлять модель, например, генерировать вывод бесконечно, мешая их дальнейшему использованию. Это все особенно неприятно при комбинации с персистентностью.
Post #63
128
