Непрямое внедрение запросов (IPI) остаётся центральной проблемой безопасности LLM: в стандартных трансформерах нет архитектурного представления о полномочиях источника, поэтому полученные документы, пользовательский ввод и системные инструкции обрабатываются одним и тем же недифференцированным вниманием, и модель вынуждена угадывать по формулировкам, что выполнять, а что считать просто данными.
Provenance-Aware Transformers — защита с учётом происхождения данных, где каждому входному токену присваивается кольцевой идентификатор происхождения, а модель дополняется вложениями с учётом провенанса, обучаемым смещением внимания к происхождению и обучаемым масштабом, который сохраняет метку при нормализации, чтобы между авторитетными и неавторитетными источниками появилась структурная граница прямо во время генерации. Чтобы прикрутить это к уже выпущенным предобученным моделям, нужен двухэтапный файнтюнинг — сначала семантика происхождения, потом поведение в задаче с учётом ограничений; в оценке такие трансформеры заметно устойчивее к IPI внутри и вне кластера, качество остаётся на уровне базовой модели, и это сдвигает безопасность LLM от хрупкого сопоставления шаблонов к явному разделению доверия.
https://arxiv.org/html/2609.21088v1
Post #3895
74
Forwarded from AI Attacks
- ❤ 1
- 👍 1
- 🔥 1