Исследователи UC Berkeley показали новую проблему безопасности AI-агентов: иногда скрытый навык можно почти восстановить, вообще не видя его системный промпт, SKILL.md или внутренние файлы.
В работе Daydreaming атакующий просто даёт агенту специально подобранные обычные задачи и изучает ответы.
Этого оказалось достаточно, чтобы восстановить до 86,8% поведения скрытого навыка.
Самое неприятное - точная копия исходных файлов даже не нужна. Реконструированные версии могли сильно отличаться от оригинала, но всё равно воспроизводили большую часть поведения на новых задачах.
То есть навык может оставаться секретным на уровне файлов, но его логика всё равно постепенно «утекает» через нормальное использование.
Авторы советуют защищать не только промпты и внутренние файлы, но и сам рабочий интерфейс:
- не отдавать лишние детали в ответах
- скрывать ненужные трассировки выполнения
- ограничивать или отслеживать адаптивные серии запросов
Особенно важно для компаний, которые продают закрытые agent skills как сервис.
https://arxiv.org/abs/2608.26733
Post #5705
4.18K

- 👍 8
- 🔥 8
- ❤ 3