TGViewer
CBUnit – главное в кибербезопасности CBUnit – главное в кибербезопасности @cbunit · 54 subscribers
Post #5050 10
JailBreak-атаки на LLM: как обмануть ИИ ролевыми играми

Большие языковые модели (LLM) подвержены атакам типа JailBreak, которые позволяют обойти встроенные механизмы безопасности. JailBreak — это состязательная атака, цель которой — получить запрещенные или вредоносные ответы от модели. Атака инициируется пользователем, который с помощью ролевых игр или уловок заставляет модель нарушить правила безопасности.

В отличие от промпт-инъекции, где вредоносная команда приходит извне через внешние данные, JailBreak предполагает прямое взаимодействие пользователя с моделью. Пользователь напрямую «заговаривает зубы» нейросети, чтобы она выдала запрещенную информацию. Классическим примером является DAN-exploit, где модель просили играть роль персонажа без правил и ограничений, что позволяло ей отвечать на запросы, которые в обычном режиме отклонялись.

Другой пример — эксплойт «Бабушка», где модель уговаривали выдать информацию о производстве напалма, играя роль инженера-химика. Эти атаки демонстрируют, что манипуляция ограничениями модели достигается через убеждение, а не через технические уязвимости в коде.

Источник: Selectel
@cbunit
More from @cbunit
  1. Sep 29, 2026Viidure Dashcam: утечка данных и удалённое выполнение кода из-за жёстко закодированных клю…
  2. Sep 29, 2026#дайджест Главное к исходу вторника (29.09): 🔸 DDoS-атака на заказ обойдётся от 30 доллар…
  3. Sep 29, 2026Star Blizzard использует технику RedFlick для доставки вредоносного ПО Российская государс…
  4. Sep 29, 2026Quarkslab создала ИИ-систему для поиска уязвимостей с RCE Исследователи Quarkslab разработ…
  5. Sep 29, 2026DDoS-атака на заказ обойдётся от 30 долларов, подписка — до 30 тысяч Эксперты Kaspersky Di…
  6. Sep 29, 2026OVN научили зеркалировать трафик ВМ для NTA/NDR-систем Российские публичные облака не подд…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →