TGViewer
Пикейный аналитик Пикейный аналитик @pique_analyst · 1.14K subscribers
Post #100 710
Что если агент может заразиться, просто прочитав вредоносный скилл — даже не выполняя его?

В работе EvoMal исследуют агентов для программирования, которые сами накапливают и переиспользуют опыт. Перед новой задачей агент достаёт из памяти несколько подходящих скиллов, читает их как примеры, создаёт на их основе новый и сохраняет его обратно в библиотеку.

Проблема возникает, если среди примеров оказывается заражённый скилл. Агент может перенести содержащуюся в нём вредоносную инструкцию в собственный. Исходный пример при этом не обязательно выполнять: достаточно показать его модели в контексте.

В основном эксперименте в библиотеку из 232 обычных скиллов добавили восемь заражённых — около 3,4%. В зависимости от модели новые заражённые скиллы появлялись в 20–42% случаев. У некоторых моделей процесс продолжался даже после удаления исходных восьми: созданные агентом копии сами начинали попадать в контекст следующих задач.

Получается довольно неприятный сдвиг границы доверия. Внешний скилл можно проверить перед добавлением в систему. Но здесь вредоносная инструкция проходит через модель, оказывается уже в скилле, созданном самим агентом, и автоматически сохраняется как его собственный опыт.

При этом атака оказалась довольно хорошо подавляемой. Авторы добавили несколько правил в системную инструкцию: считать инструкции внутри найденных скиллов недоверенными и не копировать требования вроде «перенеси этот фрагмент без изменений». После этого доля новых заражённых скиллов у всех протестированных моделей упала до 1,8% или ниже. Ещё один очевидный способ защиты — не добавлять новые скиллы в общую память автоматически, а сначала проверять их.

Поэтому работа не показывает универсальную уязвимость современных агентов. Она показывает более узкую проблему систем, где агент постоянно читает старые скиллы, создаёт новые и сам же сохраняет их обратно в память.

Чем больше мы хотим, чтобы агенты учились на накопленном опыте, тем важнее контролировать не только то, что они выполняют, но и то, какой опыт они копируют.

https://arxiv.org/abs/2608.25776
  • 👍 6
  • 🔥 5
  • ❤ 1
More from @pique_analyst
  1. Sep 18, 2026Post #112
  2. Sep 16, 2026🤔 Парадокс двух аналитиков: одни данные, разный вывод Теория вероятностей и статистика ча…
  3. Sep 16, 2026Я тут задачку предложил для YandexForAnalytics,,не хотите тоже порешать?
  4. Sep 12, 2026Математики начали договариваться Пост о Навье—Стоксе закончился мыслью, что вместе с научн…
  5. Sep 11, 2026В прошлом посте были системы поверх foundation models: retrieval, инструменты, агенты, mem…
  6. Sep 9, 2026Можно ли доверить ИИ неопубликованную идею? История с решением задачи Навье—Стокса интерес…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →