Из-за водяных знаков LLM могут стать уязвимее к промпт-инжектам
#ai #llm
Исследовательница из компании Lasso Security обнаружила, что водяные знаки SynthID-Text могут влиять на безопасность больших языковых моделей. В некоторых случаях после включения маркировки контента LLM соглашались выполнять вредоносные инструкции, которые отклоняли без SynthID. Сильнее всего этот эффект проявился при атаках с использованием промпт-инжектов.
LH | News | OSINT | AI
Post #17208
575

- 👍 2
- ❤ 1