ИССЛЕДОВАНИЕ
Откат возвращает файлы, но не последствия
Контрольная точка кажется кнопкой «отменить» для автономного агента — можно вернуть прошлое состояние и продолжить работу. Проблема в том, что внешний мир назад не откатывается. Письмо уже отправлено, платёж проведён, права доступа изменены.
Авторы нового препринта называют это разрывом непрерывности исполнения. После восстановления агент может соединить внутреннее состояние из прошлого с внешними последствиями из настоящего — хотя в нормальной истории такая комбинация никогда не существовала.
Исследователи изучили 347 трасс из TerminalBench и AgentBench в пяти системах — LangGraph, CrewAI, Hermes, Cline и E2B. Всего получилось 1 735 исполнений. В каждом они выбирали одну контрольную точку, восстанавливали её штатным способом и повторяли дальнейшие шаги.
В 67,2% этих исполнений за пределами контрольной точки осталось состояние, от которого зависела безопасность. В 67,7% повтор недетерминированных шагов дал другое значимое продолжение. Авторы также показали три сквозных сценария — обход проверки вредоносного кода, пересылку писем не из того ящика и повторную оплату по одному подтверждению.
Эти цифры нельзя читать как «две трети откатов уязвимы». Проверялся один выбранный момент на исполнение, задачи в основном были локальными или имитационными, а базовая модель была одна. Работа показывает повторяемость класса сбоев, но не измеряет риск в реальных установках.
Практический вывод — после отката прежним разрешениям и проверкам нельзя доверять автоматически. Подтверждение нужно связывать с точной версией объекта и конкретным ресурсом, внешнее состояние проверять заново, а платежи и сообщения защищать от повторного выполнения.
Возобновление работы агента — отдельная граница безопасности, а не просто кнопка «продолжить».
Источник — https://arxiv.org/abs/2608.29381v1
#ИИагенты #безопасность
Post #450
118
- 💩 2