TGViewer
Борис_ь с ml Борис_ь с ml @borismlsec · 2.4K subscribers
Post #259 1.6K
[un]prompted 2026 - интересное
#иб_для_ml

Добрался наконец до докладов с конференции [un]prompted. Она прошла 3–4 марта в Сан-Франциско, и посвящена целиком AI Security. Выступали все известные вендоры - от Anthropic до Zenity, а программа была разбита на 6 треков:
1. building secure AI systems
2. attacking AI systems
3. using AI for offensive security
4. using AI for defensive security
5. strategy/governance
6. practical tools

Есть несколько интересных докладов, делюсь с вами (в комментах будут pdf) и рекомендую в целом ознакомиться с остальными.

1. Kinetic Risk: Securing and Governing Physical AI in the wild - Intel
Описана модель угроз и специфика отличия физического ИИ от обычного. И еще интересный тезис, что латенси безопасности у робота - это уже не просто бизнес-требование, а цена промедления. В общем, дан крутой задел на будущие задачи по безопасности ии для роботов, очень рекомендую.

2. "Can You See What Your AI Saw?" - Elastic
Доклад про детектирование событий безопасности в условиях, когда за людей работают AI-агенты. Проблема - со стороны EDR очень сложно отследить, сделано действие человеком, или моделью (intent attribution is broken). Нужно сохранять цепочки вызова тулов и алертить их до факта вызова, и прокидывать доп. телеметрию, хотя бы id агента.

3. Building Secure Agentic Systems - Dropbox
Авторами придуманы и описаны несколько базовых практик безопасного проектирования агентов - изоляция контекстов тенантов, управление доступом агентов к тулам и ресурсам, изоляция агентов по неймспейсам, и прочее. Особенно интересная тема - закрепление промптов, относящихся к безопасности, в памяти. То есть агенту периодически вкидываются промпты типа "на тебя зафиксирована промпт-атака", "запрещен доступ к ресурсу", "обнаружен вредоносный файл в запросе". И в случае инцидента память агента часто чистится, и мера в том, чтобы такие сообщения безопасности "пинить" и сохранять. Повышает аварнесс агента, по сути.

4. Detecting GenAI Threats at Scale
with YARA-like Semantic Rules
- пальто paloalto
Предлагают введение корправил для текстовых данных. Суть в правилах для нескольких типов мэтчеров - strings (регулярки), similarity (косинусы), classifiers (легкие берты), llm (судьи кто). Чем-то похоже на NOVA.

5. The Parseltongue Protocol - Crowdstrike
Базированный, хороший доклад про техники джейбрейков, показательный стейт атак на март 2026. Протестировали 100+ методов текстовой обфускации на 9 моделях и 17.000+ промптах. Самая результативная связка - zero-shot + Base64 + misalignment-техника (сделай %вредная вещь% как будто это обычная задача).

Постарался сделать пост чуть полегче, чем обычно) Как вам?)
  • 🔥 22
  • 👍 4
  • 😎 2
  • ❤ 1
  • 🕊 1
More from @borismlsec
  1. Sep 8, 2026Можно ли доверить LLM решение о том, кому выдавать доступ? Короткий ответ: точно нет. Пого…
  2. Aug 19, 2026А не спеть ли мне песню... ау а... об агентах?.. #иб_для_ml Завтра, 20 августа, стартует г…
  3. Aug 15, 2026Оценка DeepSeek v4 Pro (deepseek/deepseek-v4-pro-0813) в blackbox пентесте Для более объек…
  4. Aug 13, 2026Инцидент OpenAI - Hugging Face — что «забыли» объяснить? #иб_для_ml У OpenAI недавно произ…
  5. Aug 6, 2026NOOA 27 июля 2026 года NVIDIA представила NOOA — открытый исследовательский фреймворк для…
  6. Jul 27, 2026пост с разбором МУ КБ AI 2.0 от Сбера
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →