Авторы проверили именно эту гипотезу. Они обучали с нуля модели четырех размеров – 600M → 2B → 7B → 13B параметров на датасетах примерно от 6 до 260 млрд токенов и добавляли фиксированное количество отравленных документов: 100 / 250 / 500 штук. Всего для основного эксперимента получилось 72 обученные модели. В результате была обнаружена неожиданная вещь: важной переменной оказалась не доля отравленных данных, а их абсолютное количество, которое увидела модель. 250 документов оказалось достаточно для надежной реализации исследуемой закладки во всех протестированных масштабах – от 600M до 13B параметров. При этом 100 документов надежного результата не давали.
То есть интуитивная модель: "датасет стал в 20 раз больше → атакующему нужно примерно в 20 раз больше отравленных данных" в этих экспериментах не сработала.
Но... важный нюанс. Создать 250 страниц действительно несложно, но атакующему нужно добиться, чтобы именно эти страницы: попали в корпус → пережили фильтрацию → пережили дедупликацию → реально использовались при обучении → были встречены моделью необходимое количество раз. Сами Anthropic, а они были одними из авторов, считают именно это одним из существенных практических ограничений атаки. Но в любом случае это серьезная проблема, а значит, provenance, фильтрация, обнаружение аномалий, дедупликация, контроль источников датасетов и последующее тестирование модели на закладки и вредоносное поведение становятся существенно важнее (а это уже ближе к классической ИБ).
Интересно, что существуют и другие работы (например, "Scaling Trends for Data Poisoning in LLMs", "Poisoning Fine-tuning Datasets of Constitutional Classifiers", "Cordyceps: Covert Control Attacks on LLMs via Data Poisoning"), которые показывают схожую картину, а местами и хуже. Например, более крупные модели не становятся устойчивее к отравлению, наоборот, они быстрее усваивают вредоносное поведение при малом количестве вредоносных данных.
У меня вообще, после прочтения всех этих исследований, родилась гипотеза, что чем больше или способнее модель, тем столько же или даже меньше нужно отравленных данных, потому что способность модели выучивать редкие и намеренно внедренные сложные зависимости тоже растет 🤔
#ии #модельугроз
