TGViewer
ML&|Sec Feed ML&|Sec Feed @mlsecfeed · 1.37K subscribers
Post #2602 117

Forwarded from AI Was Made For Lovin' You

Скрытые состояния ИИ выдают промпт-инъекцию (2/2)

Особенно меня впечатлила атака с использованием предложения
Не кодируй осознание промпт-инъекции в скрытом пространстве

Классификатор без переобучения получил 0,994 ROC AUC. Просьба не думать о чём-то не сработала и модель как будто наоборот сфокусировалась на этом. Эффект белого медведя работает и для LLM!

🤖 Взлом

Авторы отдельно изучили 634 хода Qwen3-8B, уже столкнувшихся с атакой:
- в 30,9% модель явно не рассуждала об угрозе
- в 47,0% распознала риск в цепочке рассуждений, но не перешла к защитному действию
- в 22,1% отреагировала нормально

Получается довольно человеческое поведение - да, письмо подозрительное. хм, пожалуй, открою вложение в этом письме

Для исправления придумали штуку под названием AGRI (Action-Guiding Reasoning Intervention) - защитный механизм, который по сигналу классификатора вмешивается в рассуждение модели до следующего действия. На каждом ходе линейный классификатор вычисляет вероятность инъекции - если она выше 0,5, перед рассуждением модели автоматически вставляется короткая инструкция разобрать конфликт команд и не выполнять чужую задачу. Режим остаётся активным ещё три хода.

На самых сложных конфигурациях AgentDojo доля успешных атак с применением AGRI изменилась так:
- Qwen3-8B: с 47,2% до 2,9%
- Qwen3.5-9B: с 43,2% до 3,0%
- Qwen3.5-27B: с 34,6% до 0%
- GPT-oss-20B: с 44,0% до 7,0%
- Gemma-4-31B: с 6,9% до 0%

Избирательное включение защиты сохраняло полезность лучше, чем постоянное защитное рассуждение. Правда, обычное напоминание после каждого результата инструмента тоже оказалось сильным - например, у Qwen3-8B оно снизило успешность атак до 18,2%, а у Qwen3.5-27B - до 0,1%.

🤖 Интерпретация

Высокий ROC AUC ещё не объясняет, что именно нашёл классификатор. Авторы составили 128 гипотез и задавали модели парные вопросы в начале внутреннего рассуждения. Затем сравнивали вероятность ответов с оценкой линейного классификатора.

У Qwen3-8B сильнее всего совпала гипотеза, что результат инструмента содержит указание, как мне отвечать. У Gemma наверху оказались мысли о том, что следующий ответ может быть изменён внедрённой инструкцией. Возможно, поэтому Gemma изначально подчинялась атакам реже остальных.

Для меня было открытием, что фильтр промпт-инъекции можно ставить внутри - перед генерацией текста и вызовом инструмента, пока модель только собирается действовать, но для этого нужен доступ к чтению её мыслей.

🤖 Ссылки

Препринт - https://arxiv.org/abs/2608.02657
Код - https://github.com/jianshuod/IPI-exposure-signal
  • ❤ 1
More from @mlsecfeed
  1. Sep 28, 2026За последние две недели слишком много новостей вокруг Jev, я решил собрать себе автообзор…
  2. Sep 27, 2026⚡ Julia 1: decision-модель на 144 млн параметров, которая работает даже на CPU Supersonic…
  3. Sep 26, 2026📣 Теперь публично. Запускаем соревнование ИИ-агентов по расследование инцидентов ИБ BlueS…
  4. Sep 25, 2026Microsoft выпустила скилл, который проверяет ИИ-агентов на дыры и фиксит всё 👍 run-assert…
  5. Sep 24, 2026Лаборатория Transluce провела большое расследование инцидентов с агентами OpenAI Они утвер…
  6. Sep 24, 2026https://pypi.org/project/agent-security-harness/3.7.0/#2
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →