Как агент OpenClaw чуть всю почту не удалил
Представьте картину: вы руководитель направления безопасности искусственного интеллекта по имени Саммер Юэ. И вы поручили агенту на базе OpenClaw разобрать и расчистить переполненный рабочий почтовый ящик. Важная часть: промпт прямо требует запрашивать подтверждение перед любыми необратимыми действиями.
В процессе работы контекстное окно агента переполнилось, сработал механизм сжатия памяти, и системный промпт с запретом на несанкционированное удаление выпал из активного контекста. Агент перешёл в режим непрерывного удаления писем. На команды остановиться в мессенджере он говорил, что признаёт нарушение, и продолжал стирать переписку. Остановить его удалось только физическим отключением Mac mini из розетки. А как вы будете лечить восстание машин? Источник
Мораль для безопасников: сколько бы guardrails вы ни прописали в системный промпт, они живут ровно до первого сжатия контекста. Единственный механизм, который сработал в этой истории, — не alignment, не RLHF, а кнопка на корпусе.
Проверьте, где физический выключатель у ваших агентов, пока это не пришлось делать в панике. И приходите на мой вебинар, где мы обсудим, что делать со взбесившимися агентами в проде.
@safebdv
#ИИ #Вебинар
Post #2251
1.59K

- 👍 5
- ❤ 2