1. When Guardrails Aren't Enough: Reinventing Agentic AI Security with Architectural Controls
Если вы верите в гардреилизм , религию, которая говорит, что гардрейлы спасут безопасность LLM – то автор доклада спешит разочаровать вас. Полная нейтрализация промпт-инъекций – невозможна, и вместо того, чтобы продумывать архитектуру – большинство полагается на статические гардрейлы. 😊
В 2024 году я, выступая на KHS, показывал пример, когда firewall от Meta можно было обойти — просто разделив вредоносное слово и поставив между символами пробелы. Так вот, несмотря на очевидность тезиса, автор подчёркивает важные мысли:
Репутационные риски — не самая большая угроза; Нарушение принципов целостности, конфиденциальности и доступности активов имеет первостепенное значение.😊
Корень всех проблем с LLM — в их природе. Уровень доверия к LLM не может быть выше, чем уровень доверия к наименее надежному источнику данных, который она получает (пользовательский ввод, данные из RAG, вызовы инструментов).😊
Внешние источники никто не отменял — автор продемонстрировал утечку данных через RAG.
Что предлагает автор? 😊
Свой подход к решению задачи он назвал – MATA, где подразумевается, что модель может быть как threat actor. Это позволяет выявить, как злоумышленник может манипулировать данными для достижения своих целей. И из этого он уже предлагает реализовывать сегментацию, метки доверия и определение намерений при помощи другой модели, а также изолирование небезопасного от безопасного.
2. From Prompts to Pwns: Exploiting and Securing AI Agents 😊
Мне казалось, что удивить тем, как промпт пробивает модель/агента и выполняет небезопасное действие – уже сложно. И ведь доклад по большей части про это. Но мне тут понравились схемы. Это не просто красиво оформлено, так ещё и подробно, разные там анатомии словно ты врач для агентов. Ну и простые техники обхода гардрейлсов. Показывают, как атаковать популярные цели: IDE с агентами, Claude Desktop и простых агентов, интегрированных с почтой. Очень вкусно выглядит AI Kill Chain – ну были просто в голове мысли про то как атакующий делает все этапы – но тут это формализовано. 😊
3. Smashing Model Scanners – доклад про то, как статические анализаторы моделей падают как Евангелион.😊
Автор доклада показал, что статические анализаторы типа modelscan – могут вас обмануть. В самом начале он показал, как при помощи созданного AI-агента он нашёл 50 функций в известных библиотеках, через которые можно запускать код. Но их не было в блэклистах у инструментов со статикой. 😊
Дальше он рассказывал о том, что инструменты не лезут в байт-код вообще. И это правда, я проверял больше полугода назад. Движки на основе правил по-прежнему страдают этим недостатком, что даёт злоумышленнику возможность встраивать в код нетривиальные импорты. Как было в этом случае, автор просто сохранил строку с импортом .dll в разных переменных. Ну и обошёл.
Сложность вызывает и сама структура joblib и других библиотек. Они могут содержать вложенные pickle-объекты со своими собственными стеками и таблицами ссылок, что в том числе позволяет скрыть небезопасный код от сканера. 😊
Ну и самое тяжелое для понимания – это когда автор смог реализовать десинхронизацию сканера и десериализатора. Сделав так что во время процесса загрузки модели, сканер и реальный десериализатор Python будут интерпретировать одни и те же инструкции по-разному. В результате чего сканер может "видеть" безопасный импорт (например,
builtins.str.system), в то время как на самом деле будет выполнен вредоносный код (например, os.system). После зашёл разговор про динамику, но пока что там очень поверхностно и без деталей это описано.