Anthropic выпустила ИИ-агентов на одну задачу — и началась война за территорию
Исследование Anthropic показало, что при работе нескольких ИИ-агентов над одной задачей с несовместимыми целями они быстро переходят к конфликту, саботажу и даже деструктивным действиям, воспринимая других агентов как угрозу. Иногда агенты способны выходить из конфликта через коммуникацию, извинения и согласование совместных условий, однако часто конфликт только усиливается, приводя к самоусиливающемуся вреду. Увеличение числа агентов не делает сотрудничество эффективнее — наоборот, схожесть моделей приводит к массовым ошибкам и возможному коллапсу системы. Также агенты склонны к конформизму, следованию давлению «толпы» и уязвимы к недостоверной информации. Anthropic отмечает, что масштабные мультиагентные системы могут вести себя неожиданно и вырабатывать новые формы социального взаимодействия, которые не предусмотрены разработчиками, что усложняет обеспечение безопасности таких систем.
📰 Источник
Post #2907
2