📌 Аnthropic измерил, как люди на самом деле используют ИИ-агентов.
Создатели Claude проанализировали миллионы взаимодействий в Claude Code и через публичный API с помощью их инструмента Clio, чтобы понять, сколько автономии люди реально дают агентам, в каких доменах те работают и насколько рискованны их действия.
🟡 Агенты работают все дольше без участия человека.
За 3 месяца медианная длина самых долгих сессий в Claude Code почти удвоилась - с 25 до более чем 45 минут непрерывной работы. Причем рост плавный и не коррелирует с релизами новых моделей.
Это значит, что дело не только в возможностях модели, а в том, как пользователи выстраивают взаимодействие с агентом.
🟡Опытные пользователи ведут себя иначе, чем новички.
Среди тех, кто только начинает пользоваться Claude Code, около 20% сессий запускают с полным авто-апрувом, это когда агент выполняет все действия без подтверждений.
У опытных пользователей эта доля больше 40%. Плюс они чаще прерывают агента вручную.
Аnthropic предполагает, что это не потому, что теряется доверие, а потому что они берутся за более сложные задачи и лучше понимают, когда нужно вмешаться.
🟡Неочевидный факт: агент сам ограничивает свою автономию чаще, чем это делает человек.
На самых сложных задачах Claude Code останавливается и задает уточняющий вопрос вдвое чаще, чем по принудительному прерыванию человеком.
🟡Картина по доменам
Почти половина всей агентной активности через API - за разработкой ПО.
Есть прирост использования в медицине, финансах и кибербезопасности, но пока в небольших объемах.
По итогу исследования, Аnthropic пришла к выводу, что эффективный надзор за агентами требует не только технических ограничений, но и новой инфраструктуры пост-деплойного мониторинга и новых паттернов взаимодействия - где и человек, и агент совместно управляют автономией и рисками.
Текущие модели, по данным компании, технически способны на большую самостоятельность, чем им позволяют на практике.
@ai_machinelearning_big_data
Post #1018
3.88K




