TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.7K subscribers
Post #5331 4.89K
⚡️ Google DeepMind показали, как собираются защищать AI-агентов

DeepMind опубликовали материал “Securing the future of AI agents” про безопасность автономных агентов внутри реальной инфраструктуры.

Чем умнее становятся агенты, тем меньше достаточно обычного alignment. Нужен отдельный системный слой защиты, который работает даже в сценарии, где агент ошибается, неправильно понимает задачу или ведёт себя не так, как ожидали.

Для этого Google DeepMind развивают AI Control Roadmap.

Что важно:

- Агентов предлагают рассматривать как потенциальный insider threat

То есть не как обычный чат-бот, а как систему с доступами, инструментами и возможностью влиять на инфраструктуру.

- Defense-in-depth вместо одной защиты

В основе остаются sandboxing, endpoint security и защита от prompt injection, но сверху добавляется контроль поведения агента.

- AI-супервизоры следят за AI-агентами

Доверенные модели анализируют reasoning, действия и планы рабочего агента. Если поведение выглядит опасным, действие можно заблокировать до ущерба.

- Права выдаются постепенно

Агент получает доступы не «всё сразу», а по мере доказанного безопасного поведения. DeepMind сравнивает это с инструктором по вождению, который доверяет ученику, но держит руку на тормозе.

- Они уже анализировали миллион задач coding-агентов

Это помогло уйти от примитивных keyword-фильтров к поиску реальных поведенческих паттернов. Например, такие мониторы уже помогают отслеживать риски вроде случайного удаления данных.

DeepMind прямо признаёт, что проблема часто не в злонамеренности агента, а в его чрезмерном усердии или неправильной интерпретации цели пользователя.


https://deepmind.google/blog/securing-the-future-of-ai-agents/
  • ❤ 7
  • 🔥 4
  • 👍 2
More from @data_analysis_ml
  1. Sep 28, 2026В рейтинге AA Intelligence Index четыре из пяти самых умных моделей теперь от Claude. Мало…
  2. Sep 28, 2026Anthropic выпустила Claude Sonnet 5.5 — новую модель с упором на код, агентные задачи и по…
  3. Sep 28, 2026🧠 Джон Маккарти - человек, который дал имя искусственному интеллекту John McCarthy (1927–…
  4. Sep 28, 2026📊Платформа данных в корпоративном контуре компании Когда компания строит собственную плат…
  5. Sep 28, 2026🚨 Китайские AI-модели обработали в 4,4 раза больше токенов на OpenRouter, чем американски…
  6. Sep 27, 2026🔎 Hyperresearch превращает Claude Code и Codex в полноценного Deep Research-агента Hyperr…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →