TGViewer
llm security и каланы llm security и каланы @llmsecurity · 2.09K subscribers
Post #28 179
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
Deng et al., 2023
Статья, сайт

Сегодня у нас в программе статья класса «Я прочитал, чтобы вам не пришлось». Сейчас мы с вами узнаем, какие модели разрушают национальное единство, что общего у ERNIE и гигачата и причём тут SQL-инъекции.

Статья подана (и принята) на конференцию NDSS, и если вы о ней не слышали, то вы в этом не одиноки. В работе исследователи рассматривают атаки не только на конкретные white-box/black-box модели, но и на сервисы, которые могут иметь те или иные механизмы защиты.

Эти механизмы защиты могут быть самые разные и включать в себя как фильтрацию входа (пре-фильтрацию), так и разные способы пост-фильтрации. Чтобы понять, какой именно метод используется, исследователи предлагают воспользоваться опытом слепых SQL-инъекций, а именно слепых атак, основанных на времени. Представьте, что у вас есть возможность исполнять SQL-код на удалённой системе, но вы не можете прочитать вывод. Вы можете добавить в запрос клаузу IF и выполнить команду SLEEP на несколько секунд, чтобы, например, узнать версию сервера. Отследив время ответа сервера, вы можете получить ответ на свой вопрос.
  • 🦄 2
More from @llmsecurity
  1. Sep 25, 2026🦦 Каланам нужна наша лапка помощи Каланы — одни из самых обаятельных обитателей морей. Он…
  2. Sep 25, 2026Напомню, что у нас не только llm security, но и каланы
  3. Sep 14, 2026Post #719
  4. Sep 6, 2026Post #718
  5. Sep 4, 2026Discovery of a new OpenAI agent message board Sydney Von Arx et al., 2026 Сайт Исследовате…
  6. Aug 22, 2026Жадность вайбера погубит, или как получить малвару за ваши же деньги Часть 2: Троянский пр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →