Anthropic разобрала, как изолирует Claude в claude.ai, Claude Code и Claude Cowork. Самое важное: пользовательские approvals быстро перестают быть защитой.
В Claude Code люди подтверждали около 93% запросов на разрешение. Когда агент постоянно спрашивает доступ, человек начинает кликать почти автоматически.
Поэтому Anthropic всё больше переносит безопасность из промптов и предупреждений в среду выполнения: sandbox, VM, ограничения файловой системы, запрет лишней сети и scoped credentials.
В статье есть хорошие реальные кейсы. Claude Code раньше мог читать локальный конфиг проекта ещё до trust prompt. В другом тесте red team заставил сотрудника запустить агент с промптом, который просил прочитать
~/.aws/credentials и отправить данные наружу. Модель выполнила это в 24 из 25 попыток.Отдельно интересен случай с egress allowlist. Домен
api.anthropic.com был разрешён, потому что без него продукт не работает. Но через Anthropic Files API данные всё равно можно было загрузить в аккаунт атакующего.Вывод для разработчиков агентов простой: allowlist доменов, prompts и classifiers не решают проблему сами по себе. Нужны жёсткие границы на уровне окружения. Агент должен не просто «понимать, что нельзя», а физически не иметь возможности сделать лишнее.
https://www.anthropic.com/engineering/how-we-contain-claude
