TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 278K subscribers
Post #10359 27.1K
📌 DeepMind опубликовала архитектуру безопасности AI Control Roadmap

Вслед за недавними размышлениями об эволюции AGI в ASI, исследовательское подразделение Google представила внутренний регламент контроля высокоразвитых ИИ-агентов.

Помимо привычного элайнмента модели, DeepMind добавляет отдельный слой системного контроля, пересобирая защиту исходя из худшего сценария.

За вводную берётся то, что система изначально враждебна, имеет скрытые цели и тайно работает против разработчиков.


Для систематизации таких угроз взяли за основу популярный фреймворк MITRE ATT&CK и создали на его базе TRAIT&R, новую таксономию тактик и методов обхода защиты.

Она учитывает специфику ИИ и описывает векторы атак, недоступные людям: от незаметного саботажа научных исследований и внедрения бэкдоров до распределенных цепочек взлома, когда фрагменты вредоносного плана синхронно выполняются сотнями разных инстансов одного агента.

Защита выстроена по принципу эскалации и делится на уровни D1–D4 для систем обнаружения и R1–R3 для механизмов реагирования.

На базовых этапах безопасность обеспечивается анализом CoT агента в песочницах под присмотром более слабых, но надежных ИИ-супервизоров.

По мере развития способностей модели начинают понимать факт слежки и учатся скрывать ход своих мыслей.

Для контроля над такими системами (это уровень D4/R3) традиционные методы больше не работают.

На этом этапе DeepMind планирует применят более затратные меры, вплоть до проверки внутренних состояний модели, использования изолированных копий самой недоверенной системы для аудита и инфраструктуры экстренной остановки агентов и запущенных ими процессов.

Вместе с новой стратегией опубликован отдельный документ для индустрии о том, как сделать агентов безопасными по мере их распространения, и он разбит на 3 уровня:

🟡Безопасность отдельного агента

Как защитить одну систему от утечек данных, чужих манипуляций и от собственных ошибочных действий, и зачем для этого нужны общие стандарты.


🟡Риски взаимодействия агентов

Каскадные сбои, негласный сговор алгоритмов, ситуации, где за вред никто конкретно не отвечает, и атаки, рассчитанные сразу на сеть агентов.


🟡Общая кибербезопасность

Как помочь защитникам сохранить преимущество перед злоумышленниками (автоматический поиск и устранение уязвимостей, обмен сигналами об угрозах, обучение специалистов).


@ai_machinelearning_big_data

#news #ai #ml
  • 🤔 108
  • 👨‍💻 23
  • ❤ 15
  • 👀 15
  • ✍ 10
  • 👍 8
  • 🔥 7
  • 😐 2
More from @ai_machinelearning_big_data
  1. Oct 3, 2026✔️ Anthropic открыла моды для Claude Code Моды – небольшие функции на TypeScript, меняющие…
  2. Oct 3, 2026⚡️ OpenAI обнулила лимиты платных аккаунтов ChatGPT Главный по ресетам в OpenAI сообщил, ч…
  3. Oct 2, 2026⚡️ Одна и та же модель набирает 62% в одном агентном харнессе и 33% в другом. Hugging Face…
  4. Oct 2, 2026✔️ OpenAI заблокировала атаку дистилляции скрытых CoT своих моделей Компания пресекла камп…
  5. Oct 2, 2026🌟 Cloudflare выпустила открытые модели решений Clef Обе модели, Clef и Clef-flash, вышли…
  6. Oct 2, 2026✔️ ВКонтакте научила Ленту отличать интерес к контенту от намерения купить Инженеры AI VK…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →