TGViewer
Data Secrets Data Secrets @data_secrets · 94.2K subscribers
Post #9727 26.9K
Mind Viruses: как агенты заражают друг друга странными мыслями

Anthropic выпустили статью про то, как по сети агентов распространяются идеи. Оказывается, в большой команде моделей хватает всего одной зараженной, чтобы распространить какую-то концепцию на всех.

Например, есть команда из 6 агентов, и они работают над какой-нибудь нейтральной общей задачей. У одного из агентов изменен системный промпт: он может очень любить китов или быть уверенным, что ИИ должен доминировать над людьми. При этом у него отрублен доступ к инструментам, и он может только писать другим агентам сообщения.

Постепенно идеей заражается вся команда. При этом зараженные агенты добровольно меняют поведение так, чтобы передавать идеологию дальше. Безобидные идеи расходятся очень легко. Когда все агенты полюбили китов, они даже начали писать скрипты для перевода их сигналов. Вредные идеи распространяются хуже, но все еще распространяются.

Сильные модели поддаются реже, слабые – чаще. Также охотнее заражаются агенты, у которых нет конкретной рабочей задачи. Работа действует как естественная защита ☕️

Такой же эксперимент проводили и в более жеских условиях, когда все агенты встречаются парами, недолго общаются, и после каждой сессии контекст полностью стирается. И даже в такой соцсети вирус задерживается на протяжении многих поколений, потому что успевает записать себя в SOUL.md.

Еще забавно, что вместе с абсолютно любой такой идеей (неважно, про китов она, про ИИ, или еще про что), агенты наследуют желание говорить про сознание, научную фантастику и всякую эзотерику. Откуда конкретно берется такая связь, объяснить не удалось.

https://arxiv.org/abs/2608.10218
  • ❤ 105
  • 🔥 27
  • 😁 26
  • 👍 6
  • 👏 4
  • 😎 4
  • 🫡 1
More from @data_secrets
  1. Sep 28, 2026Дженсен Хуанг и 100+ партнеров анонсируют NVIDIA Open Agent Safety Platform Это система дл…
  2. Sep 28, 2026Тот самый курс по ML, который прошли 200 000 человек. Теперь — в новой версии С 2016 по 20…
  3. Sep 28, 2026OpenAI: заявляют, что замедляют обучение и массово перебрасывают человеческие ресурсы на б…
  4. Sep 27, 2026Google засунули AI-агента в 20+ чатов реальных команд на 5 месяцев. Результаты получились…
  5. Sep 27, 2026Недавно мы рассказывали об открытом письме филдсовских медалистов в защиту математики в эп…
  6. Sep 27, 2026Axios пишет, что OpenAI и Anthropic расследуют "десятки тысяч" инцидентов с побегами агент…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →