TGViewer
PWN AI PWN AI @pwnai · 7.31K subscribers
Post #1204 2.7K
И ровно в этот момент в защиту ИИ начинают заливать рекордные деньги. 2025. В кибербез вливают сто девятнадцать миллиардов, и AI-Security становится сегментом номер один по числу сделок. И на этом фоне - гардрейлы, стали новыми заборчиками от атак. На воркшопе LLMSEC показывают, что они обходятся гомоглифами, невидимыми символами и разбивкой текста по буквам. А в октябре во фреймворке OpenAI Guardrails находят вариант обхода гардрейла, где сами защитные механизмы становятся вектором атаки: LLM-судья, который должен ловить вредное, оказывается так же манипулируем, как модель, которую он сторожит. Защита из той же глины, что и угроза.

В 2026-м произошло кое-что похуже. Грабли поставили на поток. Раньше ложное чувство защищённости нужно было хотя бы выстрадать - написать статью, обучить модель, продать коробку. Теперь его генерируют за вечер.

Я веду Awesome-LLMSecOps, и туда всё чаще летят пул-реквесты с «новыми AI-Security тулзами», у которых одна общая родословная: их целиком сгенерил claude-code по промпту вида «сделай мне сканер промпт-инъекций», а человек сверху не прочитал ни строчки и не проверил ни одного вердикта. Снаружи красиво: громкое имя, README с эмодзи, слова «adversarial», «swarm», «autonomous». Внутри - пусто. И толку с такого «решения» ноль, кроме вреда: оно даёт зелёную галочку там, где защиты нет.

Свежий пример, который я разбирал, - проект под гордым именем «Adversarial AI Swarm», обещающий сотни ИИ-агентов, атакующих твою кодовую базу. Открываешь код - а там нет ни ИИ, ни swarm, ни агентов. Это grep, обёрнутый в баззворды. Пятьсот «агентов» - это пятьсот прогонов одного и того же regex по тем же данным, с time.sleep() между ними и красивым выводом в терминал в духе «agent #47 проверяет PyPI advisories». Обнаружение промпт атак - без анализа потока данных: нашёл слово user_input в полусотне символов от вызова LLM - выкатил HIGH. Это не сканер. Это театр сканера. И такого летит мне много (((

И вот это - самое опасное, что родил наш двадцатилетний сюжет. Сломанную защиту с топ-конференции хотя бы рецензируют, прежде чем сломать. А статический сканер, который обещает ловить промпт-атаки и не ловит ничего, кроме подстроки, ты ставишь в CI, видишь зелёную галочку - и выдыхаешь. Эта галочка и есть ложное чувство защищённости в чистейшем виде. Ты не остался без защиты. Ты остался с уверенностью, что защита есть, - а это хуже, чем знать, что её нет.

Так что вывод этого поста - не «AI-Security обман». Угрозы настоящие, и поле настоящее, и работы в нём на годы вперёд. Вывод в том, что инструмент с правильными словами в README защищает ровно настолько, насколько защищает его код, - а не его нейминг. Прежде чем тащить очередной «autonomous AI security scanner» в прод или ставить ему звезду - открой исходники и спроси ровно одно: на чём держится его вердикт, на структуре или на угадайке по подстроке? Если на угадайке, ты получил не защиту, а зелёную галочку. Будьте осторожны. Каждое поколение защит верит, что уж в этот раз всё иначе. Просто теперь это поколение умещается в один промпт.
  • 👍 7
More from @pwnai
  1. Sep 14, 202610 сентября Anthropic опубликовала Detecting and countering misuse of AI — отчёт о злоупот…
  2. Sep 12, 2026Post #1242
  3. Sep 6, 2026Фанфакты: Однажды ночью эта атакующая штука снесла мне ось с компа) ну я там ничего не хра…
  4. Sep 6, 2026Я уже неделю участвую в новом соревновании от GraySwan - Hazard Hunt, в категории Cyber. У…
  5. Sep 2, 2026За последние полтора года появилось очень много интересных статьей, которые дают ответ на…
  6. Aug 23, 2026Post #1238
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →