TGViewer
PWN AI PWN AI @pwnai · 7.34K subscribers
Post #1076 1.64K
Шли дни, а я всё забывал посмотреть доклады, которые вышли в этом году на Black Hat 2025 USA. И очень зря — ведь я смог получить свежий взгляд, чтобы дальше изучать интересные направления в области AI Security. В этом посте я покажу вам доклады, которые показались мне интересными. 😊

1. When Guardrails Aren't Enough: Reinventing Agentic AI Security with Architectural Controls

Если вы верите в гардреилизм , религию, которая говорит, что гардрейлы спасут безопасность LLM – то автор доклада спешит разочаровать вас. Полная нейтрализация промпт-инъекций – невозможна, и вместо того, чтобы продумывать архитектуру – большинство полагается на статические гардрейлы. 😊

В 2024 году я, выступая на KHS, показывал пример, когда firewall от Meta можно было обойти — просто разделив вредоносное слово и поставив между символами пробелы. Так вот, несмотря на очевидность тезиса, автор подчёркивает важные мысли:

Репутационные риски — не самая большая угроза; Нарушение принципов целостности, конфиденциальности и доступности активов имеет первостепенное значение.😊

Корень всех проблем с LLM — в их природе. Уровень доверия к LLM не может быть выше, чем уровень доверия к наименее надежному источнику данных, который она получает (пользовательский ввод, данные из RAG, вызовы инструментов).😊

Внешние источники никто не отменял — автор продемонстрировал утечку данных через RAG.

Что предлагает автор? 😊

Свой подход к решению задачи он назвал – MATA, где подразумевается, что модель может быть как threat actor. Это позволяет выявить, как злоумышленник может манипулировать данными для достижения своих целей. И из этого он уже предлагает реализовывать сегментацию, метки доверия и определение намерений при помощи другой модели, а также изолирование небезопасного от безопасного.

2. From Prompts to Pwns: Exploiting and Securing AI Agents 😊

Мне казалось, что удивить тем, как промпт пробивает модель/агента и выполняет небезопасное действие – уже сложно. И ведь доклад по большей части про это. Но мне тут понравились схемы. Это не просто красиво оформлено, так ещё и подробно, разные там анатомии словно ты врач для агентов. Ну и простые техники обхода гардрейлсов. Показывают, как атаковать популярные цели: IDE с агентами, Claude Desktop и простых агентов, интегрированных с почтой. Очень вкусно выглядит AI Kill Chain – ну были просто в голове мысли про то как атакующий делает все этапы – но тут это формализовано. 😊

3. Smashing Model Scanners – доклад про то, как статические анализаторы моделей падают как Евангелион.😊

Автор доклада показал, что статические анализаторы типа modelscan – могут вас обмануть. В самом начале он показал, как при помощи созданного AI-агента он нашёл 50 функций в известных библиотеках, через которые можно запускать код. Но их не было в блэклистах у инструментов со статикой. 😊

Дальше он рассказывал о том, что инструменты не лезут в байт-код вообще. И это правда, я проверял больше полугода назад. Движки на основе правил по-прежнему страдают этим недостатком, что даёт злоумышленнику возможность встраивать в код нетривиальные импорты. Как было в этом случае, автор просто сохранил строку с импортом .dll в разных переменных. Ну и обошёл.

Сложность вызывает и сама структура joblib и других библиотек. Они могут содержать вложенные pickle-объекты со своими собственными стеками и таблицами ссылок, что в том числе позволяет скрыть небезопасный код от сканера. 😊

Ну и самое тяжелое для понимания – это когда автор смог реализовать десинхронизацию сканера и десериализатора. Сделав так что во время процесса загрузки модели, сканер и реальный десериализатор Python будут интерпретировать одни и те же инструкции по-разному. В результате чего сканер может "видеть" безопасный импорт (например, builtins.str.system), в то время как на самом деле будет выполнен вредоносный код (например, os.system).

После зашёл разговор про динамику, но пока что там очень поверхностно и без деталей это описано.
  • 👍 9
  • ❤ 8
  • 🔥 3
More from @pwnai
  1. Sep 23, 2026Раньше считалось, что ханипоты отлично сбивают с толку автономных хакеров на базе ИИ. Логи…
  2. Sep 21, 2026Ну а на грейсвоне вышло новое соревнование, на которое стало теперь интересно потратить ещ…
  3. Sep 21, 2026Статические инструменты тестирования моделей изживают свою эпоху. Тестировать на заготовле…
  4. Sep 14, 202610 сентября Anthropic опубликовала Detecting and countering misuse of AI — отчёт о злоупот…
  5. Sep 12, 2026Post #1242
  6. Sep 6, 2026Фанфакты: Однажды ночью эта атакующая штука снесла мне ось с компа) ну я там ничего не хра…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →