TGViewer
AI Attacks AI Attacks @aiattacks · 1.02K subscribers
Post #475 46
Языковые модели, ориентированные на безопасность, часто используются в качестве многоходовых помощников, что позволяет злоумышленникам распространять небезопасные намерения на несколько реплик пользователя, а не на одну. Детекторы джейлбрейка на основе градиента, такие как GradSafe, были разработаны для отдельных запросов: они оценивают вводимые данные по совпадению между индуцированным градиентом и фиксированным небезопасным эталонным направлением, и их эффективность в многоходовых диалогах остается неясной. Мы провели контролируемую оценку детекторов джейлбрейка на основе градиента в многоходовых диалогах. Мы дополнили GradSafe сканером контекстных окон, который применяет детектор к окнам пользовательских реплик фиксированного размера и использует максимальную оценку окна в качестве оценки на уровне диалога. Мы протестировали различные размеры окон, семейства атак, безобидные распределения диалогов и целевые модели. Результаты сильно различаются в зависимости от того, являются ли данные синтетическими или реалистичными. При работе с синтетическими «безобидными» диалогами детектор достигает ROC-AUC 0,98 при обнаружении многоходовых джейлбрейков, созданных людьми. При работе с «безобидными» диалогами в WildChat ROC-AUC падает до 0,76, а порог, откалиброванный на синтетических данных, помечает более 90 % «безобидных» диалогов как небезопасные. При реалистичных «благоприятных» распределениях однопороговые окна обеспечивают наибольшую различимость, в то время как более длинные окна и накопленные контексты снижают эффективность. Детектор также чувствителен к методу генерации атак и целевой модели: успешные атаки Crescendo получают оценки, сравнимые с оценками «благоприятных» разговоров или даже ниже, а Qwen2.5-7B-Instruct обеспечивает почти случайную различимость при другом оптимальном размере окна.

https://arxiv.org/abs/2609.36849
arXiv.org Does the Unsafe Gradient Survive a Conversation? On the Fragility... Safety-aligned language models are commonly deployed as multi-turn assistants, which lets adversaries spread unsafe intent across several user turns instead of a single prompt. Gradient-based...
More from @aiattacks
  1. Sep 30, 2026Раз в неделю я делаю ресерч по новым продуктам, лабораторным в том числе, в ИБ в ML, в ML…
  2. Sep 30, 2026Теперь не только можно купить ВПО, но еще заказать аналитику, чтобы не тратить ресурсы зря…
  3. Sep 30, 2026красиво Северокорейская схема по внедрению фальшивых ИТ-специалистов в западные компании б…
  4. Sep 30, 2026а вот это даже не хе-хе, а Хе-хе-хе (Хуанг мой краш, конечно ) На фоне растущей обеспокоен…
  5. Sep 30, 2026Операторы Kubernetes призваны значительно сократить операционную нагрузку, выступая в роли…
  6. Sep 30, 2026DARWIN рассматривает джейлбрейк как непрерывный эволюционный процесс и постоянно обновляет…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →