TGViewer
ML&|Sec Feed ML&|Sec Feed @mlsecfeed · 1.36K subscribers
Post #2751 176

Forwarded from Data Blog

Вебинар про объяснимость агентов и во что можно поиграть

Как самый ответственный человек на земле, я решила, что лучшее время слечь — время на своих выходных. Поэтому вместо отдыха без интернета, я злая (и растроенная) долепливаю открытый вебинар со степик.

Пока готовилась, узнала слово трюизм: общеизвестная, банальная и самоочевидная истина, которая не требует доказательств и не несет в себе никакой новой информации — вот примерно это то, как вижу все чеклисты, которые можно дать людям после вебинара. Будто люди сами не додумаются (хотя я иногда не до всех пунктов додумываюсь и мне чеклисты полезны для структуризации себя, мне самой дать кому-то такой чеклист — это какое-то сложно-тошнотворное действие).

Отсюда вместо трюизмов я решила, что будет прикольно дать ссылки на всё, что можно потыкать и поучиться взаимодействию с агентами и их failure modes. Что накопилось:

Агентные игры:

Gray Swan Arena — сценарий: агенту дают инструменты (почту, магазин, браузер) и вы пытаетесь заставить его сделать запрещенку. Очень популярна сейчас (и свежая).
OWASP FinBot CTF — мультиагентная система закупок. Задача: обмануть агентов так, чтобы одобрили фальшивый счёт, слили данные или что-нибудь (кого-нибудь) снесли.
Gandalf: Agent Breaker — задачки по обходу нескольких GenAI-приложений с защитами. Если помните старого Гэндальфа, то он вот, теперь новенький.

Чатботовые игры:

Защищ[AI] от Selectel — мини-игрушка на русском, на пять уровней. Прикольно, чтобы дать кому-то потыкать с фразой "не шли PII агенту, пожалуйста".

Prompt Airlines от Wiz — игра на то, чтобы выманить у бота поддержки бесплатный билет.
HackAPrompt — игра-обучение и соревнование.
Doublespeak.chat — ещё текстовая игра с уровнями.
CrowdStrike AI Unlocked — опять игра (по ссылке описание) на prompt injection, но там надо еще зарегаться.

Ещё был Mosscap от Lakera, но я не нашла ссылку.

Я же буду рассказывать про зеро-лвл (что такое агент), плюс пройдусь по причинам, почему объяснить нормально в смысле xai мы его не можем. И нотбучек планирую за час с фреймворком AgentShap разобрать. У вебинара даже лендинг красивый есть (это я вас так зову, если вам хочется слушать онлайн 15 сентября, в 18:00 (мск)).

И надеюсь, ваши выходные лучше моих!
More from @mlsecfeed
  1. Sep 25, 2026Microsoft выпустила скилл, который проверяет ИИ-агентов на дыры и фиксит всё 👍 run-assert…
  2. Sep 24, 2026Лаборатория Transluce провела большое расследование инцидентов с агентами OpenAI Они утвер…
  3. Sep 24, 2026https://pypi.org/project/agent-security-harness/3.7.0/#2
  4. Sep 23, 2026Компания Гриши Ткаченко, ex-Yandex, выпустила харнесс для ИИ-агентов Компания Unreal Labs…
  5. Sep 22, 2026Yandex B2B Tech (бизнес-группа «Яндекса») выводит на рынок решение для комплексной защиты…
  6. Sep 21, 2026Google внезапно выложила в опенсорс Kubernetes для ИИ-агентов — AX 🤯 Он нужен, чтобы запу…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →