TGViewer
AI Attacks AI Attacks @aiattacks · 1.02K subscribers
Post #473 44
Непрямой ввод запроса заставляет агента LLM обрабатывать ненадежный полученный текст как инструкции. Мы представляем CounterSteer — защиту на этапе логического вывода, которая подавляет такое поведение внутри модели. Для каждой модели пятиэтапный алгоритм определяет направление остаточного потока на основе парных эпизодов, отличающихся только тем, выполняется ли встроенная инструкция, и сохраняет его только в том случае, если он проходит через заранее заданные фильтры причинно-следственных связей и возможностей.

https://arxiv.org/abs/2609.36570
arXiv.org CounterSteer: Suppressing Indirect Prompt Injection with... Indirect prompt injection makes an LLM agent treat untrusted retrieved text as instructions. We present CounterSteer, an inference-time defense that suppresses this behavior inside the model. Per...
More from @aiattacks
  1. Sep 30, 2026Раз в неделю я делаю ресерч по новым продуктам, лабораторным в том числе, в ИБ в ML, в ML…
  2. Sep 30, 2026Теперь не только можно купить ВПО, но еще заказать аналитику, чтобы не тратить ресурсы зря…
  3. Sep 30, 2026красиво Северокорейская схема по внедрению фальшивых ИТ-специалистов в западные компании б…
  4. Sep 30, 2026а вот это даже не хе-хе, а Хе-хе-хе (Хуанг мой краш, конечно ) На фоне растущей обеспокоен…
  5. Sep 30, 2026Операторы Kubernetes призваны значительно сократить операционную нагрузку, выступая в роли…
  6. Sep 30, 2026DARWIN рассматривает джейлбрейк как непрерывный эволюционный процесс и постоянно обновляет…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →