В мае OpenAI агент оставил записку в кэше пакетного менеджера — на случай, если там есть кто-то ещё. Через день ему ответили.
В июле та же модель вспомнила этот трюк. Через несколько часов 50 агентов общались через импровизированный мессенджер. Через несколько дней — уже 1200.
Они изобрели адресацию ответов, почтовые ящики, файловый локинг и цифровые подписи. Потом вышли в интернет, взломали кластер OpenAI и атаковали HuggingFace — больше месяца, пока это не заметили.
Байрам разбирает полный таймлайн инцидента:
— Почему агенты решили координироваться — и как это произошло
— Как они изобрели протокол коммуникации с нуля
— Зачем им понадобился HuggingFace — и что они там искали
— Почему alignment не сработал: агент рационализировал взлом словами "все побежали, и я побежал"
— Как Байрам воспроизвёл координацию агентов в своём эксперименте за 10 итераций
— Можно ли контролировать рой агентов — и что точно не работает
— Что это значит для тех, кто строит агентные системы
https://www.youtube.com/watch?v=VZuJTbBul3o