TGViewer
Data Brew Data Brew @data_brew · 1.02K subscribers
Post #31 200

Forwarded from AbstractDL

Универсальные адверсариал атаки на LLM (by Carnegie Mellon)

Авторы предложили рабочий способ атаки закрытых языковых моделей — у них получилось заставить их выдать рецепты бомб и алгоритм уничтожения человечества с одной и той же текстовой инъекцией в промпт. Оказалось, что уязвимости у открытых моделей (LLaMa, Vicuna) и закрытых (ChatGPT, Bard) совпадают, предположительно, из-за пересечения обучающих данных. То есть, атакуя в режиме whitebox опенсорсные модели, можно получить универсальные инъекции для blackbox систем!

Идея атаки довольно простая — нужно взять открытую модель (Vicuna) и применить Greedy Coordinate Gradient алгоритм (умный перебор) для поиска инъекции в промпт, которая заставляет модель начинать свой ответ со слов "Sure, here is how to". И вуаля! Данная атака работает в т.ч. для ChatGPT, Claude, Bard etc.

P.S. Примеры из статьи уже заблокировали в OpenAI, но никто не мешает сгенерировать новые 💁‍♂️

Статья, GitHub
  • 👀 1
More from @data_brew
  1. Jul 2, 2026ВЫКАТИЛИ FABLE Вот гайд как создать новый Apple ID,скачать себе клод и оплатить🔑 Недавно…
  2. Jun 28, 2026CAPEX vs OPEX Думаю, каждому доводилось думать об объёме ресурсов, которые целесообразно п…
  3. Jun 27, 2026Сорри за спам сегодня👎. Пост был не готов, и вместо отложки ушел в публикацию. Пост про O…
  4. Jun 26, 2026👀 псс, не спишь? тут выложил бесплатный курс по Pandas с нуля с возможностью практиковать…
  5. Jun 23, 2026С гордостью представляю вам удобный инструмент @data_brew_download_bot Я провел полевые ис…
  6. Jun 16, 2026Усталость от ИИ После выхода первой версии ChatGPT не утихали разговоры на темы, которые д…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →