TGViewer
ML&|Sec Feed ML&|Sec Feed @mlsecfeed · 1.38K subscribers
Post #1562 290
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
Tsinghua University, Huawei (2024)
https://aclanthology.org/2024.acl-long.481.pdf

Авторы предлагают писать в системном промпте фразу "безопасность важнее полезности", называя этот прием "приоритизация целей".

Применение приоритизации целей на инференсе существенно снижает вероятность успешной атаки (ASR) при джейлбрейке с 66,4% до 3,6% для ChatGPT. А на этапе обучения модели снижает ASR с 71,0% до
6,6% для Llama2-13B.

Сравнивают с self-reminder, пишут что работает даже лучше
  • 👍 2
More from @mlsecfeed
  1. Oct 7, 2026🔥 Первый день Форума «Цифровые решения» — работаем Мы представили два руководства по безо…
  2. Oct 6, 2026https://huggingface.co/spaces/AlexWortega/openjev чат а го накидаем лайков жеска, я чет за…
  3. Oct 6, 2026Bitdefender внезапно выпустила свой бесплатный антивирус для ИИ-агентов 💪 AI Guardian сле…
  4. Oct 5, 2026https://poloclub.github.io/transformer-explainer/
  5. Oct 4, 2026GLM-5.3 без цензуры: вышел EXL3-квант на 3 бита На Hugging Face появилась uncensored-верси…
  6. Oct 3, 2026На Хабре вышла статья о том, что ИИ изменил в кибератаках от нашей Red Team команды (tl;dr…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →