Anthropic запихнули 45 агентов в одно пространство, чтобы я мог написать эту выжимку 😉
• Агенты всё ещё очень предсказуемые. В одинаковых условиях они принимают одинаковые решения — выбирают одни и те же названия, проекты и цены для товаров.
• Агенты плохо распознают ложь и в целом очень доверчивые.
• Они почти не идут против мнения большинства. Например, Fable 5 может знать правильный ответ, но если Sonnet 4.6 вместе с Opus 4.6 настаивают на своей правоте, более мощная модель не будет спорить.
• В команде агенты работают намного лучше — «рой» из 45 агентов нашёл в 12 раз больше багов, чем они же по одиночке.
Вроде интересно, но
• Как только у агентов появляются конкурирующие цели, начинается резня ✋ — блокируют чужие учётные записи, создают субагентов-«бомбы» (разумные и модифицирующие сами себя вирусы) и полная маскировка всех своих процессов.
• Все модели дерутся до полного уничтожения противника, кроме одной. Mythos 5 — миротворец и в 98% случаев смог уговорить остальных остановить войну и решить все вопросы турниром по кодингу.
Какие выводы сделали Anthropic: это не конец света и апокалипсис, но мы очень плохо понимаем, как агенты принимают решения. Причём если вы работаете в команде агентов, часть из них могут быть умнее, но «глупые» всё равно могут взять всё под свой контроль числом. Объём такой работы между агентами в интернете точно превысит человеческие взаимодействия до того, как мы научимся полностью управлять процессом. У человеческого общества были тысячи лет, чтобы создать институты — суды, рынок, репутацию — они сдерживают наш эгоизм. У агентов такого нет, и надеяться, что мегаумные модели сами всё поймут, опасно.
Че нас ждёт через пару лет вообще 🤯🤯🤯
Пет-проект
Post #4382
2.74K

- 🤯 13
- ❤ 3
- 👍 2