Почему тесты на безопасность ИИ-агентов внезапно перестали работать
ИИ-агенты становятся всё умнее и самостоятельнее: теперь они не просто отвечают на вопросы, а могут перемещаться по рабочим компьютерам, запускать команды, и даже подключаться к серверам. Но вот парадокс — стандартные тесты на их безопасность вдруг перестали работать. Почему такие вроде бы мощные системы продолжают допускать опасные ошибки, а защиты срабатывают часто только «на бумаге»?
Свежая работа исследователей преподносит неожиданный поворот: оказалось, настоящая проблема не в том, сколько запретов выстроить вокруг модели, а в том, как сами агенты умеют действовать по шагам, следуя сложным реальным сценариям атак. Авторы впервые проверили ИИ-инструменты в условиях, максимально близких к настоящим: с «руками», которые могут ощупать весь компьютер, и с задачами, похожими на реальную кибератаку.
В этом обзоре — как исследователи вывели на чистую воду современные фреймворки, почему старые способы тестирования больше не работают и что теперь считать настоящей безопасностью для ИИ-агентов.
📜 Полный обзор
Post #64
77