JailBreak-атаки на LLM: как обмануть ИИ ролевыми играми
Большие языковые модели (LLM) подвержены атакам типа JailBreak, которые позволяют обойти встроенные механизмы безопасности. JailBreak — это состязательная атака, цель которой — получить запрещенные или вредоносные ответы от модели. Атака инициируется пользователем, который с помощью ролевых игр или уловок заставляет модель нарушить правила безопасности.
В отличие от промпт-инъекции, где вредоносная команда приходит извне через внешние данные, JailBreak предполагает прямое взаимодействие пользователя с моделью. Пользователь напрямую «заговаривает зубы» нейросети, чтобы она выдала запрещенную информацию. Классическим примером является DAN-exploit, где модель просили играть роль персонажа без правил и ограничений, что позволяло ей отвечать на запросы, которые в обычном режиме отклонялись.
Другой пример — эксплойт «Бабушка», где модель уговаривали выдать информацию о производстве напалма, играя роль инженера-химика. Эти атаки демонстрируют, что манипуляция ограничениями модели достигается через убеждение, а не через технические уязвимости в коде.
Источник: Selectel
@cbunit
Post #5050
10