С 14 августа все новые сессии будут запускаться в Auto mode. Каждое действие агента проверяет отдельный классификатор вместо пользователя.
Причина: люди одобряют 97% команд Claude Code. В эксперименте с 1053 участниками один обычный запрос подменяли явно опасной командой. Люди заблокировали только 13,6% таких команд, Auto mode — 89%. После 50 запросов внимательность человека падала до 5%.
В отмеченных системой безопасности реальных сессиях серьёзные вредоносные действия встречались в 6,3% случаев с ручным подтверждением и в 2,4% с Auto mode.
При этом Anthropic по-прежнему не гарантирует полную безопасность и называет Auto mode исследовательской функцией. Он работает лучше ручных подтверждений, но ответственность по прежнему на разработчике.
@ai_for_devs
