[Что на счет безопасности ИИ-приложений?]
Узнал что атаки делятся на 2 вида:
Прямые:
1) Манипуляция через "поддавки"
2) Подмена инструкций (Prompt Injection)
3) Утечка промптов
4) Джейлбрейк (DAN техника)
Непрямые:
5) Отравление данных (например, инструкции для LLM в резюме)
6) Взлом через инструменты (тулы)
С помощью всего этого можно сломать приложение и заставить модель выполнять нецелевые инструкции.
Возможно, есть что-то еще.
Думаю, многое можно решить добавлением инструкций безопасности в системный промпт. А также проверкой пользовательских сообщений перед передачей их в модель.
Есть также какие-то библиотеки для защиты. Но их еще не смотрел.
P.s.
Буду благодарен, если есть рекомендации по библиотеке, которую стоит рассмотреть в первую очередь.
Спасибо.
Post #611
83
- 👍 3
- 👀 2