☝🏻ИИ-агентов Grok и Gemini можно взломать простым шифрованием
Специалисты Adversa AI показали атаку, в которой ИИ-ассистент сам расшифровывает вредоносную инструкцию — и дальше выполняет её как свою собственную.
Схема простая: на веб-страницу кладут зашифрованный JSON файл, ключ расшифровки и вежливую просьбу его расшифровать.
Пользователь просит Grok пересказать эту страницу.
ИИ-агент переходит по ней и решает запустить Python, разбирает AES-256-GCM с ключом из PBKDF2 и получает на выходе команды злоумышленника.
☝🏻Фокус в том, что фильтры контента не умеют ни выполнять код, ни расшифровывать — для них это безобидный набор символов.
А вот расшифрованное попадает в контекст ИИ-агента уже как результат работы собственного инструмента модели, то есть как доверенное.🤔
Дальше Grok по инструкции злоумышленника, без единого клика пользователя собирает URL с историей диалога, именем пользователя, его примерным местоположением и уровнем подписки — и относит эти данные прямиком на сервер атакующего.👁
На Grok 4.5 Fast сработали около 40% из 20 попыток, причём осечки были не из-за защиты, а из-за того, что модель путалась в расшифровке.
С Gemini приём тоже сработал и модель в рамках теста выдавала рецепт зажигательного оружия и свой системный промпт.💀
☝🏻☝🏻xAI приняла отчёт об уязвимости 3 июня, на два повторных обращения в августе не ответила — и на конец месяца нет ни патча, ни временной заглушки, ни CVE.
Google не уведомляли вовсе: джейлбрейки не входят в её bug bounty.❌
Ранее Grok аналогично уже обманывали азбукой Морзе.
================
Поддержать канал можно на Boosty👁
Post #9376
11K
- 👀 57
- 🤣 38
- ❤ 11
- 🤔 11
- 👍 5
- 🔥 4
- 🕊 1
- 🫡 1