Feed for @borismlsec channel
author: @ivolake
Post #2755
140
Forwarded from Пост Лукацкого

Зашел тут разговор о том, как можно отравить обучающий датасет при разворачивании в корпоративной среде собственной LLM (ну как собственной, на базе Qwen/DeepSeek/GLM/Kimi) и какой корпус данных нужен для этого. И мне показалось интересным, в контексте, вспомнить про исследование "Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples", которое развенчивает миф о том, чтобы отравить модель, атакующему надо контролировать определенную долю от обучающей выборки (0,1%, 0,01% или какую-то другую). Отсюда возникало довольно успокаивающее ИБшников соображение, на котором иногда строились и модели угроз для ИИ, – чем больше датасет, тем больше данных придется подложить атакующему для отравления.
Авторы проверили именно эту гипотезу. Они обучали с нуля модели четырех размеров – 600M → 2B → 7B → 13B параметров на датасетах примерно от 6 до 260 млрд токенов и добавляли фиксированное количество отравленных документов: 100 / 250 / 500 штук. Всего для основного эксперимента получилось 72 обученные модели. В результате была обнаружена неожиданная вещь: важной переменной оказалась не доля отравленных данных, а их абсолютное количество, которое увидела модель. 250 документов оказалось достаточно для надежной реализации исследуемой закладки во всех протестированных масштабах – от 600M до 13B параметров. При этом 100 документов надежного результата не давали.
Но... важный нюанс. Создать 250 страниц действительно несложно, но атакующему нужно добиться, чтобы именно эти страницы: попали в корпус → пережили фильтрацию → пережили дедупликацию → реально использовались при обучении → были встречены моделью необходимое количество раз. Сами Anthropic, а они были одними из авторов, считают именно это одним из существенных практических ограничений атаки. Но в любом случае это серьезная проблема, а значит, provenance, фильтрация, обнаружение аномалий, дедупликация, контроль источников датасетов и последующее тестирование модели на закладки и вредоносное поведение становятся существенно важнее (а это уже ближе к классической ИБ).
Интересно, что существуют и другие работы (например, "Scaling Trends for Data Poisoning in LLMs", "Poisoning Fine-tuning Datasets of Constitutional Classifiers", "Cordyceps: Covert Control Attacks on LLMs via Data Poisoning"), которые показывают схожую картину, а местами и хуже. Например, более крупные модели не становятся устойчивее к отравлению, наоборот, они быстрее усваивают вредоносное поведение при малом количестве вредоносных данных.
У меня вообще, после прочтения всех этих исследований, родилась гипотеза, что чем больше или способнее модель, тем столько же или даже меньше нужно отравленных данных, потому что способность модели выучивать редкие и намеренно внедренные сложные зависимости тоже растет 🤔
#ии #модельугроз
Авторы проверили именно эту гипотезу. Они обучали с нуля модели четырех размеров – 600M → 2B → 7B → 13B параметров на датасетах примерно от 6 до 260 млрд токенов и добавляли фиксированное количество отравленных документов: 100 / 250 / 500 штук. Всего для основного эксперимента получилось 72 обученные модели. В результате была обнаружена неожиданная вещь: важной переменной оказалась не доля отравленных данных, а их абсолютное количество, которое увидела модель. 250 документов оказалось достаточно для надежной реализации исследуемой закладки во всех протестированных масштабах – от 600M до 13B параметров. При этом 100 документов надежного результата не давали.
То есть интуитивная модель: "датасет стал в 20 раз больше → атакующему нужно примерно в 20 раз больше отравленных данных" в этих экспериментах не сработала.
Но... важный нюанс. Создать 250 страниц действительно несложно, но атакующему нужно добиться, чтобы именно эти страницы: попали в корпус → пережили фильтрацию → пережили дедупликацию → реально использовались при обучении → были встречены моделью необходимое количество раз. Сами Anthropic, а они были одними из авторов, считают именно это одним из существенных практических ограничений атаки. Но в любом случае это серьезная проблема, а значит, provenance, фильтрация, обнаружение аномалий, дедупликация, контроль источников датасетов и последующее тестирование модели на закладки и вредоносное поведение становятся существенно важнее (а это уже ближе к классической ИБ).
Интересно, что существуют и другие работы (например, "Scaling Trends for Data Poisoning in LLMs", "Poisoning Fine-tuning Datasets of Constitutional Classifiers", "Cordyceps: Covert Control Attacks on LLMs via Data Poisoning"), которые показывают схожую картину, а местами и хуже. Например, более крупные модели не становятся устойчивее к отравлению, наоборот, они быстрее усваивают вредоносное поведение при малом количестве вредоносных данных.
У меня вообще, после прочтения всех этих исследований, родилась гипотеза, что чем больше или способнее модель, тем столько же или даже меньше нужно отравленных данных, потому что способность модели выучивать редкие и намеренно внедренные сложные зависимости тоже растет 🤔
#ии #модельугроз











