Из-за водяных знаков LLM могут стать уязвимее к промпт-инжектам
Исследовательница из компании Lasso Security обнаружила, что водяные знаки SynthID-Text могут влиять на безопасность больших языковых моделей. В некоторых случаях после включения маркировки контента LLM соглашались выполнять вредоносные инструкции, которые отклоняли без SynthID. Сильнее всего этот эффект проявился при атаках с использованием промпт-инжектов.
https://xakep.ru/2026/09/25/sampling-drift/
Post #20115
2.97K

- 🦄 6
- 👍 3
- 🤔 3
- 😁 2
- 🤣 2
- 🤯 1
- 💩 1