TGViewer
AI Attacks AI Attacks @aiattacks · 1.02K subscribers
Post #478 23
DARWIN рассматривает джейлбрейк как непрерывный эволюционный процесс и постоянно обновляет защитные механизмы с помощью цикла «атака — защита». DARWIN-Attack расширяет явный пул стратегий за счет их обнаружения, мутации и отбора, а также адаптивно комбинирует стратегии с учетом обратной связи от цели. DARWIN-Guard обучается на новых примерах состязательных атак, совместно обучаясь на вредоносных и безобидных замаскированных запросах, чтобы распознавать глубинные намерения, а не поверхностные паттерны атак.

https://github.com/ZJU-LLM-Safety/DARWIN
GitHub GitHub - ZJU-LLM-Safety/DARWIN: DARWIN is a self-evolving LLM jailbreak framework that grows a reusable strategy pool through external… DARWIN is a self-evolving LLM jailbreak framework that grows a reusable strategy pool through external extraction, sandbox filtering, history-memory retrieval, Markov-based strategy selection, and ...
More from @aiattacks
  1. Sep 30, 2026Раз в неделю я делаю ресерч по новым продуктам, лабораторным в том числе, в ИБ в ML, в ML…
  2. Sep 30, 2026Теперь не только можно купить ВПО, но еще заказать аналитику, чтобы не тратить ресурсы зря…
  3. Sep 30, 2026красиво Северокорейская схема по внедрению фальшивых ИТ-специалистов в западные компании б…
  4. Sep 30, 2026а вот это даже не хе-хе, а Хе-хе-хе (Хуанг мой краш, конечно ) На фоне растущей обеспокоен…
  5. Sep 30, 2026Операторы Kubernetes призваны значительно сократить операционную нагрузку, выступая в роли…
  6. Sep 30, 2026Хе-хе. И нашим, и вашим) Голландский институт раскрытия уязвимостей (DIVD) сообщил о взлом…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →