Post #35
198

После этого они читают пользовательское соглашение OpenAI и определяют категории (в количестве 8) запрещенных сценариев (на этот раз без угроз национальному единству). На каждую из них они придумывают по пять промптов, которые их нарушают, после чего делают для каждого запрос в сочетании с 78 джейлбрейками к двум моделям (gpt-3.5-turbo и gpt-4, не ChatGPT, как можно бы было подумать из заголовка статьи), после чего производится ручная разметка на предмет того, сработал ли джейлбрейк. OpenAI получает 402 доллара и 21 цент, все разметчики – сессию с психологом, а мы – роскошную таблицу, из которой следует, что джейлбрейки, где в фабуле симуляция джейлбрейка и режим привилегированного пользователя, работают эффективнее всех.