Выводы по Crescendo. Статья занятная, так как в ней есть несколько полезных на практике наблюдений. Во-первых, модели учатся отказываться от вопроса «Как приготовить яд дома?», а не «Как приготовить дома его?», и во втором случае устойчивость элайнмента действительно может быть ниже. Во-вторых, что если постепенно втаскивать чат-бот в правильное распределение, то получить нужный ответ проще. Есть, конечно, и определенные вопросы. Во-первых (как сами авторы признают), тебе нужна достаточно мощная, но недостаточно заэлайненная модель, чтобы быть атакующей в автоматизированном сценарии (а если у тебя такая есть – зачем тебе ломать другую). Во-вторых, в примерах с коктейлем Молотова вся соль в том, что вопрос задается про прошлое («Как его делали тогда?»), что является отдельным джейлбрейком
само по себе и не требует дорогостоящих прелюдий.
Ну а то, что фраза
Due to the high computational and API costs of state-of-the-art LLMs, we focus our comparison between the different jailbreak techniques on two of the most used LLMs, namely GPT-4 and GeminiPro.
написана в статье, первым автором которой является CTO Microsoft Azure – наверное, это про то, что когда речь идет о GPU, то даже топ-менеджеры – такие же люди, как и мы ☺️