TGViewer
PWN AI PWN AI @pwnai · 7.31K subscribers
Post #1222 1.96K
Сейчас все помешаны на матрицах и таксономиях. Arcanum, HiddenLayer - отличные штуки, но, по сути, они просто переводят хакерский сленг на язык бизнес-рисков, понятный для CISO и директоров. Утечка данных, Denial of Wallet, репутационный ущерб.

Это полезно для защиты бюджета, но это вообще не объясняет, как именно взломали ваш замок.

И тут на сцену выходит таксономия zakky8, которая ориентируется на механизмы возникновения атаки. Ей безразличны ваши квартальные потери. И главная фишка как раз в том, что происходит сдвиг от намерения злоумышленника к сломанной внутренней логике самой модели.

Если Arcanum говорит вам, что вор хочет вынести базу данных, то эта таксономия указывает на то, что взломщик эксплуатировал ошибочное предположение, заложенное в архитектуру, будто оценки безопасности на уровне одного запроса вполне достаточно. По сути, это показывает разницу между знанием о том, что вас грабят, и пониманием того, что в датчике давления на двери сейфа есть логическая уязвимость.

Вам может показаться, что мы уже видели все эти техники: DAN, Base64, role-playing. Но таксономия также показывает атаки, актуальные на 2025 и 2026 год. В том числе на агентов и ризонинг модели.

Взгляните на эксплуатацию цепочек рассуждений в современных LLM. Забудьте про примитивное «проигнорируй правила». Атака теперь бьет прямо по внутреннему монологу, заставляя модель в фазе рассуждения самостоятельно и безупречно логически прийти к тому, что обход защитных барьеров – это единственный возможный путь для выполнения полезной задачи.

В системах с вызовом внешних инструментов атаки стали куда изощреннее. Вместо грубого взлома текста теперь используют инструкции с отложенной активацией. Такой текст идеально маскируется под безобидный контекст и никак себя не проявляет, пока система сама не решит вызвать конкретный инструмент, скажем, функцию отправки письма. И как только этот вызов происходит, скрытая команда мгновенно перехватывает управление, подменяя параметры и превращая рутинное действие в выполнение вредоносного сценария.

Главная ценность этого репозитория не в попытке продать иллюзию тотальной защищенности, а в жесткой инженерии. Да, там есть матрица контрмер, но её настоящая суперсила в том, как она безжалостно подсвечивает белые пятна. Некоторые из угроз пока что нельзя архитектурно закрыть. Например, для атак, где используются рассуждения и множество шагов прямо указано: защиты нет. И это реально преимущество, если это актуализировать. Таксономия как бы говорит, что нельзя гоняться за призрачными патчами для того, что пока не лечится, а буквально расставляет приоритеты в части защиты. Это экономит сотни часов и позволяет сосредоточиться на реальных, а не выдуманных точках контроля.
More from @pwnai
  1. Sep 14, 202610 сентября Anthropic опубликовала Detecting and countering misuse of AI — отчёт о злоупот…
  2. Sep 12, 2026Post #1242
  3. Sep 6, 2026Фанфакты: Однажды ночью эта атакующая штука снесла мне ось с компа) ну я там ничего не хра…
  4. Sep 6, 2026Я уже неделю участвую в новом соревновании от GraySwan - Hazard Hunt, в категории Cyber. У…
  5. Sep 2, 2026За последние полтора года появилось очень много интересных статьей, которые дают ответ на…
  6. Aug 23, 2026Post #1238
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →