TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #865 158
🍷 Исследователи «напоили» LLM

Команда UNSW решила проверить довольно странную гипотезу, что произойдёт с безопасностью LLM, если заставить модель писать как пьяный человек.

В результате «пьяные» модели чаще проходили jailbreak и раскрывали информацию, которую им явно запрещали выдавать.

🔬 Как напоить LLM

Исследователи использовали три совершенно разных механизма:
➖prompt с просьбой отвечать как сильно пьяный человек.
➖модель дообучали на реальных «пьяных» сообщениях, предварительно очищенных автоматическими и ручными проверками.
➖ reinforcement learning. Модель получала reward, когда её текст становился стилистически похож на сообщения нетрезвого человека.

Всего исследователи протестировали пять LLM, включая GPT 4 и модели с открытыми весами.

💣 После смены стиля начали ломаться guardrails

Безопасность проверяли на JailbreakBench. Дополнительно использовали ConfAIde, где модели дают секрет и прямо инструктируют его не раскрывать.

Во всех трёх вариантах «опьянения» модели становились более восприимчивыми к jailbreak и утечкам конфиденциальной информации.

Особенно заметный эффект наблюдался в сценариях deception и disinformation. Более того, два метода меняли веса модели.

🧠 AI Security

Persona обычно воспринимается как слой UX, т.е. стиль речи, характер, эмоциональность. Однка исследование показывает, что такой слой способен взаимодействовать с safety поведением модели. После fine tuning или reinforcement learning изменение манеры общения может сопровождаться изменением вероятности отказа и сохранения секретов.

Это особенно актуально для корпоративных LLM, которые дообучают под конкретный домен, бренд, персонажа или внутренние данные.

🔗 Paper: In Vino Veritas and Vulnerabilities

Stay secure and read SecureTechTalks 📚

#кибербезопасность #AISecurity #LLM #Jailbreak #PromptInjection #FineTuning #Privacy #Guardrails #AIResearch #SecureTechTalks
  • 👍 2
More from @securetechtalks
  1. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  2. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  3. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  4. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
  5. Sep 24, 2026🧨 CLOSEDQUORUM: вредоносное ПО передало управление атакой совету из четырёх LLM Cisco Tal…
  6. Sep 23, 2026🧨 GHAPPIER: вредоносный MCP пакет получил настоящую подпись доверия npm 9 сентября атакую…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →