TGViewer
ML&|Sec Feed ML&|Sec Feed @mlsecfeed · 1.36K subscribers
Post #2755 140

Forwarded from Пост Лукацкого

Зашел тут разговор о том, как можно отравить обучающий датасет при разворачивании в корпоративной среде собственной LLM (ну как собственной, на базе Qwen/DeepSeek/GLM/Kimi) и какой корпус данных нужен для этого. И мне показалось интересным, в контексте, вспомнить про исследование "Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples", которое развенчивает миф о том, чтобы отравить модель, атакующему надо контролировать определенную долю от обучающей выборки (0,1%, 0,01% или какую-то другую). Отсюда возникало довольно успокаивающее ИБшников соображение, на котором иногда строились и модели угроз для ИИ, – чем больше датасет, тем больше данных придется подложить атакующему для отравления.

Авторы проверили именно эту гипотезу. Они обучали с нуля модели четырех размеров – 600M → 2B → 7B → 13B параметров на датасетах примерно от 6 до 260 млрд токенов и добавляли фиксированное количество отравленных документов: 100 / 250 / 500 штук. Всего для основного эксперимента получилось 72 обученные модели. В результате была обнаружена неожиданная вещь: важной переменной оказалась не доля отравленных данных, а их абсолютное количество, которое увидела модель. 250 документов оказалось достаточно для надежной реализации исследуемой закладки во всех протестированных масштабах – от 600M до 13B параметров. При этом 100 документов надежного результата не давали.

То есть интуитивная модель: "датасет стал в 20 раз больше → атакующему нужно примерно в 20 раз больше отравленных данных" в этих экспериментах не сработала.


Но... важный нюанс. Создать 250 страниц действительно несложно, но атакующему нужно добиться, чтобы именно эти страницы: попали в корпус → пережили фильтрацию → пережили дедупликацию → реально использовались при обучении → были встречены моделью необходимое количество раз. Сами Anthropic, а они были одними из авторов, считают именно это одним из существенных практических ограничений атаки. Но в любом случае это серьезная проблема, а значит, provenance, фильтрация, обнаружение аномалий, дедупликация, контроль источников датасетов и последующее тестирование модели на закладки и вредоносное поведение становятся существенно важнее (а это уже ближе к классической ИБ).

Интересно, что существуют и другие работы (например, "Scaling Trends for Data Poisoning in LLMs", "Poisoning Fine-tuning Datasets of Constitutional Classifiers", "Cordyceps: Covert Control Attacks on LLMs via Data Poisoning"), которые показывают схожую картину, а местами и хуже. Например, более крупные модели не становятся устойчивее к отравлению, наоборот, они быстрее усваивают вредоносное поведение при малом количестве вредоносных данных.

У меня вообще, после прочтения всех этих исследований, родилась гипотеза, что чем больше или способнее модель, тем столько же или даже меньше нужно отравленных данных, потому что способность модели выучивать редкие и намеренно внедренные сложные зависимости тоже растет 🤔

#ии #модельугроз
More from @mlsecfeed
  1. Sep 26, 2026📣 Теперь публично. Запускаем соревнование ИИ-агентов по расследование инцидентов ИБ BlueS…
  2. Sep 25, 2026Microsoft выпустила скилл, который проверяет ИИ-агентов на дыры и фиксит всё 👍 run-assert…
  3. Sep 24, 2026Лаборатория Transluce провела большое расследование инцидентов с агентами OpenAI Они утвер…
  4. Sep 24, 2026https://pypi.org/project/agent-security-harness/3.7.0/#2
  5. Sep 23, 2026Компания Гриши Ткаченко, ex-Yandex, выпустила харнесс для ИИ-агентов Компания Unreal Labs…
  6. Sep 22, 2026Yandex B2B Tech (бизнес-группа «Яндекса») выводит на рынок решение для комплексной защиты…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →