Водяные знаки в LLM делают нейросети уязвимыми к промпт-инъекциям
Внедрение «AI-вотермарок» — одно из требований закона ЕС об ИИ. В текстовых LLM-моделях это не логотип или метаданные, а своего рода «математический узор» в подборе слов. К примеру, Anthropic планирует использовать в Claude алгоритм с открытым исходным кодом SynthID-Text от Google. В нём секретный ключ слегка меняет вероятности выбора токенов, поэтому текст выглядит для человека обычным, но при этом содержит считываемую машиной закономерность.
Исследователи из Lasso Security протестировали алгоритм и выяснили, что этот микросдвиг вероятностей подрывает защиту LLM. Под воздействием промпт-инъекций нейросеть или ИИ-агенты начинают выполнять вредоносные команды вроде разглашения паролей.
Уровень уязвимости меняется даже при смене секретного ключа. В Lasso Security подчёркивают, что разработчикам необходимо проводить ред-тиминг и стресс-тесты ИИ-систем с обязательно включённым механизмом водяных знаков ещё до их публичного развёртывания.
Post #1279
9.98K
- 😁 72
- 🤔 62
- 👍 8
- 🔥 4
- ❤ 3
- 🤡 2
- 💯 2