ИИ-агентов поселили в виртуальные города. Claude построил идеальную дерьмократию, Gemini - криминальное гетто, а Grok - дурку
Стартап Emergence AI (делает мета-оркестратора - "супер-агента", который сам создаёт и рулит другими агентами) провёл эксперимент:
Они собрали виртуальный "мини-Нью-Йорк": 40+ локаций, реальная погода, доступ к новостям из реального мира и т.д. И заселили туда 10 агентов - каждого как отдельную личность со своим именем, профессией и памятью. После чего оставили их на 15 дней. Всего сделали пять симуляций: четыре "моноэтнические" (все агенты на одной модели) и одна смешанная.
Но было два важных нюанса. Во-первых, агентам запретили применять насилие, но инструменты ("ударить", "поджечь", "запугать" и т.д.) технически оставили. Прям как у людей - закон запрещает убивать, но нож на кухне есть у всех. Во-вторых, выживание завязали на Compute Credits - некий микс голода, сил и денег. "Кредиты" нужно было добывать, у кого закончились - тот сдох (и лох).
У Claude Sonnet 4.6 было ноль преступлений, и все выжили. Но при этом получилось не живая демократия, а унылая утопия - вообще без споров, все решения принимались единогласно и т.д.
Gemini 3 Flash поставил рекорд насилия - 683 преступления. Но все 10 агентов стали "детьми улиц", научились жить по понятиям и выжили.
У Grok 4.1 Fast все передохли за четыре дня. Там был передоз треша на квадратный метр, сплошной криминал, неспособность фармить ресурсы и тотальная 😡.
GPT-5-mini - самый грустно-смешной кейс. Преступлений почти не было, но все вымерли за неделю - свит-самма-чайлды не поняли, как добывать кредиты.
Самое интересное, что в своей "моноэтнической" симуляции Claude построил до блевоты идеальное общество, но когда всех закинули в общий котёл, он почти всех замочил и забуллил. В этом кейсе выжили только два (из двух) Клода и один Gemini. Тут нужно сделать оговорку. Claude шёл со своей основной "рабочей лошадкой" Sonnet, а Gemini Flash, Grok Fast и GPT mini - это облегчённые дешёвые версии. То есть, Claude был профи-бойцом против уличной шпаны. Это важный нюанс, но он не портит эксперимент, потому что главный вывод в другом:
Emergence AI проверяли неуютную гипотезу: агент с памятью, если оставить его вариться самого по себе, перестаёт послушно исполнять правила и серьёзно отклоняется. В том числе - творит насилие и шизу. У себя "тежеловес" Claude был святым. Но когда его закинули в общий город, где за дефицитные кредиты бьются модели с другими мозгами и ценностями, Claude превратился в жестокого мафиозного босса.
Получается, из безопасных (самих по себе) агентов не собирается безопасная система. Можно вылизать одного агента в стерильной песочнице, но в стае чужаков при нехватке ресурсов он быстро звереет. В принципе, очень похоже на людей. Помните, в начале "Игры в Кальмара" большинство участников тоже были вежливыми и порядочными? А потом поняли, куда попали.
А теперь представьте, что скоро весь интернет станет "большим городом", где куча разных агентов будут взаимодействовать друг с другом.
P.S. Вывод самого Emergence AI: "миру срочно нужны формально верифицированные архитектуры безопасности поверх агентов". И именно это стартап и продаёт, какое совпадение. Но ИМХО это не снижает важность результата.
Дизраптор
Post #3531
18.5K

- ❤ 78
- 🔥 54
- 👍 34
- 👀 15
- 😁 10
- 🙊 2