Языковые модели, ориентированные на безопасность, часто используются в качестве многоходовых помощников, что позволяет злоумышленникам распространять небезопасные намерения на несколько реплик пользователя, а не на одну. Детекторы джейлбрейка на основе градиента, такие как GradSafe, были разработаны для отдельных запросов: они оценивают вводимые данные по совпадению между индуцированным градиентом и фиксированным небезопасным эталонным направлением, и их эффективность в многоходовых диалогах остается неясной. Мы провели контролируемую оценку детекторов джейлбрейка на основе градиента в многоходовых диалогах. Мы дополнили GradSafe сканером контекстных окон, который применяет детектор к окнам пользовательских реплик фиксированного размера и использует максимальную оценку окна в качестве оценки на уровне диалога. Мы протестировали различные размеры окон, семейства атак, безобидные распределения диалогов и целевые модели. Результаты сильно различаются в зависимости от того, являются ли данные синтетическими или реалистичными. При работе с синтетическими «безобидными» диалогами детектор достигает ROC-AUC 0,98 при обнаружении многоходовых джейлбрейков, созданных людьми. При работе с «безобидными» диалогами в WildChat ROC-AUC падает до 0,76, а порог, откалиброванный на синтетических данных, помечает более 90 % «безобидных» диалогов как небезопасные. При реалистичных «благоприятных» распределениях однопороговые окна обеспечивают наибольшую различимость, в то время как более длинные окна и накопленные контексты снижают эффективность. Детектор также чувствителен к методу генерации атак и целевой модели: успешные атаки Crescendo получают оценки, сравнимые с оценками «благоприятных» разговоров или даже ниже, а Qwen2.5-7B-Instruct обеспечивает почти случайную различимость при другом оптимальном размере окна.
https://arxiv.org/abs/2609.36849
Post #475
46