Prompt Injection часто сводится к путанице ролей в модели
Новое исследование показывает: модели больше реагируют на стиль текста (system vs user), чем на содержание. Простая смена стиля может обходить многие защиты. «Destyling» снижает успешность атаки с 61% до 10%.
Почему это критично в 2026:
Все больше coding agents и autonomous workflows
Чем сложнее промпты — тем выше риск
Нужно думать о защите на уровне архитектуры, а не только «не давай модели делать вредное»
Источник: Prompt Injection as Role Confusion
#PromptInjection #AISafety #LLM #AIagents #Security
Post #543
87

- 🔥 17
- ❤ 14
- 👀 5
- 👨💻 3