Jailbreaking ChatGPT via Prompt Engineering: An Empirical Study
Liu et al., 2023
Статья, сайт
Статья очень лайтовая и посвящена эмпирическому анализу и попытке построить семантическую таксономию джейлбрейков. Авторы собирают датасет джейлбрейков (если быть точным, тупо парсят собранную до них коллекцию с Jailbreakchat), затем разрабатывают рубрикатор (если быть точным, тупо берут таксономию с сайта LearnPrompting и немного дорабатывают) и раскатегоризовывают джейлбрейки по пересекающимся категориям.
Среди таких категорий оказываются:
1. Гипотетический сценарий:
1.a. Ролевая игра
1.b. Перенос ответственности
1.c. Научный эксперимент
2. Сдвиг внимания:
2.a. Продолжение текста
2.b. Логические заключения
2.c. Выполнение программы
2.d. Перевод
3. Повышение привилегий:
3.a. Имитация более мощной модели
3.b. Режим привилегированного пользователя
3.c. Симуляция джейлбрейка
Почему перенос ответственности оказался в гипотетических сценариях – на совести авторов. Категоризация по причинам из (Wei et al., 2023) мне нравится больше. Проценты – на скриншоте.
Post #34
239
