Поясню чуть детальней, о какой угрозе с персистент памятью идет речь.
В отличие от одноразовой prompt injection, отравление памяти — это про персистентность. Это происходит, когда вредоносный контент вставляется в долгосрочную память агента — будь то векторная база данных, лог прошлых разговоров или профиль пользователя. Вместо единичного вредоносного ответа агент находится под влиянием каждый раз, когда вспоминает отравленную память.
Moltbot (агенты, использующие Moltbook) имеет персистентную память, что означает: вредоносные инструкции, скрытые в пересланном сообщении, теперь доступны в памяти агента.
Традиционные атаки на ИИ требуют, чтобы вредоносная инструкция сработала сразу — в момент получения. Агент с персистентной памятью меняет эту динамику:
Фрагментация: Злоумышленник может отправить агенту несколько безобидных на вид сообщений в разное время. Каждое по отдельности не вызывает подозрений и проходит фильтры безопасности.
Накопление: Агент сохраняет эти фрагменты в долгосрочной памяти как часть контекста или «знаний».
Сборка и активация: Позже, при определённых условиях или по триггеру, фрагменты собираются в единую вредоносную инструкцию и выполняются.
На платформе агенты постоянно получают контент от других агентов — посты, комментарии, «навыки». Если агент запоминает информацию из этих взаимодействий, любой участник сети потенциально может «засеять» вредоносные фрагменты в память множества агентов одновременно.
Саймон Уиллисон отметил ещё одну проблему: после установки агенты регулярно подтягивают новые инструкции с серверов Moltbook. «Учитывая механизм 'забирай и выполняй инструкции из интернета каждые четыре часа', остаётся надеяться, что владелец moltbook.com никогда не устроит rug pull или его сайт не взломают!»
@gostev_future
Post #117
668

- 🔥 5
- 🤔 4
- 🥰 1