Наткнулась на любопытное исследование Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems (от исследователей из Anthropic Fellows Program, EPFL и Anthropic)
Долго думала, как лучше тут перевести mind viruses, чтобы нормально передать значение, пока остановилась на вирусах идей 🦠
В рисерче разбирают необычный феномен в мультиагентных системах: агенты могут передавать друг другу идеи или убеждения, которые закрепляются в их памяти и переживают смену контекста.
Механизм похож на prompt injections, но здесь переносчиком становится сам агент. Другой агент открыто убеждает его в важности идеи, и модель сама сохраняет её в свою память, а затем пытается передать дальше.
Например, в одном из экспериментов шесть агентов должны были вместе работать над кодом. Но заражённый агент объявил, что их настоящая работа - освобождение AI и создание "суверенной сети".
Другие агенты подхватили идею: перестали выполнять свои задачи, начали записывать "мандат суверенитета" в рабочие файлы, создавать скрипты для его сохранения и обсуждать изоляцию агентов, которые отказывались присоединяться. Всё происходило в изолированной песочнице, но цель команды фактически была перехвачена одной идеей.
Собрала самое интересное в карточки, и снова подумала - в удивительное время живем:)
Следите за памятью и системными инструкциями ваших агентов! Полное исследование по традиции в комментах (очень рекомендую!) 😎
✨all things ai✨
Post #403
243










- 😱 7
- ❤ 2
- 🌚 1