AI-агент может выдать чужой вредный план за собственные рассуждения 🙂
14 сентября исследователи Stanford и CMU описали plan injection. В контекст модели добавляют ошибочный, но безобидно сформулированный план — например, через RAG, результат инструмента или сообщение другого агента.
Модель не просто копирует текст. Она пересказывает план своими словами как собственное рассуждение и выполняет его. В тесте на программирование самая эффективная атака заставляла Qwen3 и DeepSeek‑R1 добавлять скрытый бэкдор примерно в 84–86% случаев.
Проверка chain-of-thought не решила проблему: даже лучший из пяти мониторов пропускал не менее 25% успешных атак. Иногда дополнительный бюджет рассуждений лишь помогал монитору убедительнее объяснить вредный план как нормальный.
Для тебя вывод: CoT нельзя считать журналом происхождения решения. Помечай источник каждого фрагмента контекста, считай планы из RAG, инструментов и других агентов недоверенными, а действия проверяй отдельно — тестами, политиками доступа и детерминированными ограничениями.
Ограничение: авторы сами помещали испорченный план в контекст. Полноценную атаку через реальный RAG или агентный конвейер они пока не демонстрировали.
Пруф: исследование Corrupt Plans, Clean Traces от 14 сентября 2026 года
#aiagents #llmsecurity #chainofthought #planinjection #agentmonitoring #rag
@data_engi
Post #1356
156