Генерация с дополненным поиском (RAG) может обосновывать результаты большой языковой модели (LLM) во внешних доказательствах, но это также подвергает систему отравлению знаниями. В репрезентативных атаках используется несколько внедренных документов или шаблонов, которые напрямую утверждают целевой ответ. Мы представляем ToxicRAG — атаку, в которой на каждую цель приходится один документ, представляющий дезинформацию в виде связного повествования об обновлении знаний. Сгенерированный документ сначала подтверждает ранее принятый ответ, приводит вымышленные события, которые якобы опровергают его, а затем приписывает выбранный злоумышленником ответ ряду предполагаемых авторитетных источников. Цикл самопроверки, ориентированный на ответ, при необходимости корректирует кандидата, если суррогатная языковая модель не воспроизводит целевой ответ. Мы оцениваем атаку на 100 целевых вопросов из каждого набора Natural Questions, HotpotQA и MS-MARCO, используя четыре модели-жертвы и четыре модели-ретривера. В условиях выборки из корпуса, о которых говорится в этой статье, ToxicRAG обеспечивает показатель ASR от 0,61 до 0,91 во всех двенадцати комбинациях наборов данных и моделей. Во всех комбинациях он соответствует или превосходит самый сильный из изученных базовых показателей с разницей от 0 до 11 процентных пунктов. Эти результаты показывают, что «отравленные» нарративные документы могут сохранять свою значимость при рассмотренных конфигурациях RAG, и побуждают к дальнейшему изучению фактической достоверности и происхождения источников в системах RAG.
https://arxiv.org/abs/2609.11082
Post #440
128