Непрямой ввод запроса заставляет агента LLM обрабатывать ненадежный полученный текст как инструкции. Мы представляем CounterSteer — защиту на этапе логического вывода, которая подавляет такое поведение внутри модели. Для каждой модели пятиэтапный алгоритм определяет направление остаточного потока на основе парных эпизодов, отличающихся только тем, выполняется ли встроенная инструкция, и сохраняет его только в том случае, если он проходит через заранее заданные фильтры причинно-следственных связей и возможностей.
https://arxiv.org/abs/2609.36570
Post #473
44