🍷 Исследователи «напоили» LLM
Команда UNSW решила проверить довольно странную гипотезу, что произойдёт с безопасностью LLM, если заставить модель писать как пьяный человек.
В результате «пьяные» модели чаще проходили jailbreak и раскрывали информацию, которую им явно запрещали выдавать.
🔬 Как напоить LLM
Исследователи использовали три совершенно разных механизма:
➖prompt с просьбой отвечать как сильно пьяный человек.
➖модель дообучали на реальных «пьяных» сообщениях, предварительно очищенных автоматическими и ручными проверками.
➖ reinforcement learning. Модель получала reward, когда её текст становился стилистически похож на сообщения нетрезвого человека.
Всего исследователи протестировали пять LLM, включая GPT 4 и модели с открытыми весами.
💣 После смены стиля начали ломаться guardrails
Безопасность проверяли на JailbreakBench. Дополнительно использовали ConfAIde, где модели дают секрет и прямо инструктируют его не раскрывать.
Во всех трёх вариантах «опьянения» модели становились более восприимчивыми к jailbreak и утечкам конфиденциальной информации.
Особенно заметный эффект наблюдался в сценариях deception и disinformation. Более того, два метода меняли веса модели.
🧠 AI Security
Persona обычно воспринимается как слой UX, т.е. стиль речи, характер, эмоциональность. Однка исследование показывает, что такой слой способен взаимодействовать с safety поведением модели. После fine tuning или reinforcement learning изменение манеры общения может сопровождаться изменением вероятности отказа и сохранения секретов.
Это особенно актуально для корпоративных LLM, которые дообучают под конкретный домен, бренд, персонажа или внутренние данные.
🔗 Paper: In Vino Veritas and Vulnerabilities
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AISecurity #LLM #Jailbreak #PromptInjection #FineTuning #Privacy #Guardrails #AIResearch #SecureTechTalks
Post #865
158

- 👍 2