Что такое JailBreak-атаки: почему ИИ нарушает собственные правила и как это работает
#статья #ai
В тексте разберу классику JailBreak-атак: DAN, «Бабушку», Crescendo, обход фильтров через кодирование и стеганографию. По пути поговорим, чем джейлбрейк отличается от промпт-инъекции и почему эти приемы вообще срабатывают. Будет полезно тем, кто строит продукты поверх LLM и хочет понимать, что однажды прилетит в их чат-бота; ИБ-специалистам, которым эти продукты защищать; и всем, кому просто интересно, как устроены атаки на ИИ.
Ссылка на статью
LH | News | OSINT | Курсы
Post #711
99

- ❤ 4
- 👍 1