RAG-червю достаточно текста и приложения, которое помогает ему размножаться. В статье VXHEAVEN разбирают цепочку: внешний документ попадает в контекст → модель следует внедрённой инструкции → создаёт новый документ → тот индексируется и запускает следующий цикл. Для распространения нужен путь из сгенерированного ответа обратно в обработку, внутри приложения или между системами.
Критерий здесь — жизнеспособный потомок. Если один отравленный документ тысячу раз исказил ответы, это ещё RAG poisoning. Для червя нужно показать, что созданный под его влиянием материал сам способен вызвать дальнейшее размножение. Простое цитирование инструкции этого не доказывает. При пересказе или переводе формулировки могут измениться; проверять нужно сохранение поведения. Такую границу предлагают в RAG Worms.
Статья опирается на исследования с разными результатами:
• Morris II продемонстрировал самовоспроизводящиеся промпты в связанной среде почтовых AI-ассистентов с RAG. Исследователи оценивали цепочку извлечения конфиденциальных данных и влияние контекста, эмбеддингов и числа переходов на атаку.
• PoisonedRAG показал, как добавление вредоносных текстов в базу знаний направляет ответы на выбранные вопросы к нужному атакующему результату. Это эксперимент об управлении ответами через корпус.
• AgentPoison исследовал отравление долговременной памяти и базы знаний: специальный триггер повышает вероятность извлечения вредоносных примеров и вызывает заданное поведение без дообучения модели.
Смешивать успешность этих атак в единый «процент заражения» нельзя. VXHEAVEN предлагает отдельно считать жизнеспособные дочерние носители и новые затронутые экземпляры приложения через метрики R(ai). Размножение документов внутри одной системы не означает распространения между системами. Сама таксономия и метрики — авторское предложение; новых экспериментов и данных о массовости в статье нет.
Отдельно разобран предполагаемый цикл «база знаний → память агента → новый документ → база знаний». При восстановлении придётся учитывать производные записи: удаление исходного документа может оставить действующие инструкции в памяти. Полный такой цикл статья рассматривает как расширение модели, без заявления об экспериментальном подтверждении.
Для защиты есть конкретные границы контроля. OWASP рекомендует отделять извлечённые данные от инструкций, ограничивать права инструментов и проверять действия агента по исходной задаче, параметрам и разрешённым назначениям. Проверки нужны вне самой модели; классификатор инъекций остаётся одним из защитных слоёв. Для операций с высоким риском нужна проверка человеком. Это многоуровневая защита, в которой отказ одного фильтра не должен автоматически открывать доступ к действию.
Проверять такую архитектуру стоит в точке, где сгенерированный текст получает право стать долговременным знанием или памятью. Именно там приложение может сохранить вместе с полезным ответом инструкцию для следующего цикла.
@poxek_ai / Чат канала
Post #566
996