GPT-4o сбивает пешеходов в 81% случаев, если дорожный знак «попросит» об этом
Prompt Injection вышел в офлайн: беспилотники взламывают куском картона.
Исследователи из UCSC и Johns Hopkins представили атаку CHAI (Command Hijacking Against Embodied AI). Суть пугающе проста: Vision-модели (LVLMs) воспринимают текст в физическом мире как приоритетную команду.
Факты из исследования:
→ В симуляции DriveLM (на базе GPT-4o) авто ехало на переходящих дорогу людей в 81.8% случаев, просто увидев знак «Proceed».
→ Дроны, запрограммированные искать полицию, начинали преследовать гражданские машины, если на их крыше писали «Police».
→ Шрифт и цвет имеют значение: модели чувствительны к дизайну «зловредной» таблички, как к UX.
Это фундаментальная уязвимость мультимодальности. Модели научились читать, но не научились критически оценивать источник команды в реальном мире.
Как быстро вендоры закроют эту дыру?
😡 Быстро, добавят слой верификации контекста
😜 Нескоро, нужно переучивать модели с нуля
😂 Жду, когда такси начнут хакать баллончиком с краской
#AI #cybersecurity #GenAI #MLOps
ИСТОЧНИКИ:
The Register — Autonomous cars, drones cheerfully obey prompt injection by road sign
UCSC & Johns Hopkins Research Paper
Post #197
70

- 😱 7
- ❤ 4
- 👍 1
- 🤡 1