TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.7K subscribers
Post #5201 5.23K
🔥 Anthropic показала, почему AI-агентов нельзя защищать только кнопкой «разрешить»

Anthropic разобрала, как изолирует Claude в claude.ai, Claude Code и Claude Cowork. Самое важное: пользовательские approvals быстро перестают быть защитой.

В Claude Code люди подтверждали около 93% запросов на разрешение. Когда агент постоянно спрашивает доступ, человек начинает кликать почти автоматически.

Поэтому Anthropic всё больше переносит безопасность из промптов и предупреждений в среду выполнения: sandbox, VM, ограничения файловой системы, запрет лишней сети и scoped credentials.

В статье есть хорошие реальные кейсы. Claude Code раньше мог читать локальный конфиг проекта ещё до trust prompt. В другом тесте red team заставил сотрудника запустить агент с промптом, который просил прочитать ~/.aws/credentials и отправить данные наружу. Модель выполнила это в 24 из 25 попыток.

Отдельно интересен случай с egress allowlist. Домен api.anthropic.com был разрешён, потому что без него продукт не работает. Но через Anthropic Files API данные всё равно можно было загрузить в аккаунт атакующего.

Вывод для разработчиков агентов простой: allowlist доменов, prompts и classifiers не решают проблему сами по себе. Нужны жёсткие границы на уровне окружения. Агент должен не просто «понимать, что нельзя», а физически не иметь возможности сделать лишнее.

https://www.anthropic.com/engineering/how-we-contain-claude
  • ❤ 17
  • 🔥 8
  • 👍 7
More from @data_analysis_ml
  1. Sep 29, 2026⚡️ GPT-6 Astra помогла найти контрпримеры к гипотезе о плазме, которой почти 60 лет. В тер…
  2. Sep 29, 2026⚡️ OpenAI на DevDay показала сразу несколько крупных новинок. Главное: - GPT-6.1 Sol - поч…
  3. Sep 29, 2026ИИ уже может принять в контекст миллионы токенов. А мы всё чаще просим его написать даже о…
  4. Sep 29, 2026Anthropic готовится к IPO с необычным предупреждением для инвесторов: её модели могут пред…
  5. Sep 28, 2026В рейтинге AA Intelligence Index четыре из пяти самых умных моделей теперь от Claude. Мало…
  6. Sep 28, 2026Anthropic выпустила Claude Sonnet 5.5 — новую модель с упором на код, агентные задачи и по…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →