DARWIN рассматривает джейлбрейк как непрерывный эволюционный процесс и постоянно обновляет защитные механизмы с помощью цикла «атака — защита». DARWIN-Attack расширяет явный пул стратегий за счет их обнаружения, мутации и отбора, а также адаптивно комбинирует стратегии с учетом обратной связи от цели. DARWIN-Guard обучается на новых примерах состязательных атак, совместно обучаясь на вредоносных и безобидных замаскированных запросах, чтобы распознавать глубинные намерения, а не поверхностные паттерны атак.
https://github.com/ZJU-LLM-Safety/DARWIN
Post #478
23