🦦🔪🦜
контакт: @conversational_cat
Post #117
150

Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
Hu et al., 2024
Статья, сайт
Сегодня снова поговорим о защитах, и на этот раз у нас свежая статья исследователей из Гонконга и IBM Research про защиту от джейлбрейков. Есть несколько способов предотвращать джейлбрейки, которые могут включать в себя повышение устойчивости модели (например, за счет системного промпта) или попытки задетектировать джейлбрейк до того, как он вообще в сеть попадет, например, расчет перплексии ввода, если речь идет об атаках типа GCG. Предлагаемый в статье метод относится ко второй категории и крутится вокруг идеи расчета «функции потери от отказа» (refusal loss function). Что это такое? Давайте разберемся.
Hu et al., 2024
Статья, сайт
Сегодня снова поговорим о защитах, и на этот раз у нас свежая статья исследователей из Гонконга и IBM Research про защиту от джейлбрейков. Есть несколько способов предотвращать джейлбрейки, которые могут включать в себя повышение устойчивости модели (например, за счет системного промпта) или попытки задетектировать джейлбрейк до того, как он вообще в сеть попадет, например, расчет перплексии ввода, если речь идет об атаках типа GCG. Предлагаемый в статье метод относится ко второй категории и крутится вокруг идеи расчета «функции потери от отказа» (refusal loss function). Что это такое? Давайте разберемся.















