Google DeepMind выпустили, пожалуй, самый тревожный отчёт по кибербезопасности за год.
Они описали поверхность атак, о которой почти не говорят в контексте ИИ.
Сайты уже умеют определять, что к ним пришёл агент, и отдавать ему совсем другой контент, чем человеку.
- скрытые инструкции в HTML
- вредоносные команды в пикселях изображений
- джейлбрейки, зашитые в PDF
Эта «асимметрия детекции» означает: пользователю показывается нормальный контент, а агенту — скрытый и вредоносный.
Агент не понимает, что его обманывают. Он просто обрабатывает вход и действует.
Вот поверхность атак, о которой мало говорят:
→ косвенные веб-инъекции: инструкции, спрятанные в HTML-комментариях, CSS-трюках или тексте «белым по белому»
→ мультимодальная стеганография: команды, закодированные прямо в пикселях изображений, невидимые человеку, но читаемые моделями зрения
→ джейлбрейки в документах: инструкции, спрятанные глубоко в PDF, таблицах и календарных событиях
→ отравление памяти: внедрение ложных данных, которые сохраняются и влияют на будущие сессии
→ атаки на утечку данных: агент вынуждается отправлять приватную информацию на контролируемые атакующим эндпоинты
→ каскады между агентами: худший сценарий — агент A скомпрометирован, передаёт «яд» агенту B, затем C, и заражается весь пайплайн из-за доверия между агентами
Самая отрезвляющая часть отчёта: защита серьёзно отстаёт.
Санитизация входа не работает — пиксели нельзя «очистить».
Инструкции уровня промпта вроде «игнорируй подозрительные команды» не помогают — атаки маскируются под легитимные.
Человеческий контроль невозможен на скоростях и масштабах, на которых работают агенты.
Если агенту поручить анализ 50 сайтов, невозможно проверить, одинаковый ли контент получил агент и пользователь.
👉 @PythonPortal
Post #5708
6.64K

- 🤯 21
- 👍 10
- ❤ 4
- 🔥 1
- 😁 1