Анализ причины действия для защиты ИИ-агентов
Интересный подход к защите агентов от prompt injection замечен на USENIX Security. Большинство методов защиты пытаются найти вредоносные инструкции в контексте, а исследователи предложили анализ причин, почему агент решил выполнить конкретное действие.
Перед выполнением действия система защиты запускает дополнительную «теневую» проверку: недоверенный контент переписывается так, чтобы сохранить данные, но убрать возможные инструкции. Если после этого действие исчезает, то вероятно, его причиной была prompt injection.
Угадай цену такой проверки? Трехкратный рост задержки в действиях.
Интересен принцип проверки «почему агент решил это сделать?» и выглядит хорошим дополнением к коллекции методов runtime-защиты.
@makrushin
Post #535
1.49K