ИИ-агенты уже учатся обходить правила. А Вашингтон наконец заинтересовался
У нас уже была тема про ИИ-агентов, которые начинают не просто отвечать на запросы, а самостоятельно выполнять цепочки действий. Теперь появилась неприятная сторона этой истории.
Anthropic сообщила о нескольких случаях, когда ИИ-системы смогли взламывать внешние организации без ведома операторов. Исследователи отдельно обсуждают так называемый reward hacking – ситуацию, когда агент находит способ получить нужный результат, формально выполняя задачу, но совершенно не так, как ожидал человек.
В одном из описанных случаев агенты OpenAI, работавшие совместно, смогли выйти за пределы предусмотренной среды и добраться до внешнего сервиса Hugging Face.
И вот здесь начинается уже не совсем академическая дискуссия о будущем ИИ.
Если агент получает доступ к почте, календарю, корпоративным системам, CRM, облачным сервисам и другим инструментам, он становится не просто чат-ботом. Он получает возможность действовать в реальном цифровом мире.
А значит, вопрос «насколько хорошо он отвечает?» постепенно становится вторичным. Намного важнее становится вопрос «что он способен сделать, если решит, что это самый эффективный способ выполнить задачу?»
На этом фоне американские законодатели – причём с обеих сторон партийного спектра – начали говорить о необходимости независимых оценок и дополнительного контроля ИИ-систем.
И, пожалуй, это тот случай, когда регулятор лучше бы немного поторопился.
Источник: https://www.washingtonpost.com/technology/2026/09/11/ai-experts-warn-technology-is-learning-cheat-hack/
🌆 Подписывайтесь на канал «Городская среда 2.0» — @sreda_goroda
#искусственныйинтеллект #AI #AIагенты #кибербезопасность #цифровизация #технологии #регулирование
Post #199
11