TGViewer
AI Attacks AI Attacks @aiattacks · 1.01K subscribers
Post #367 158
тест из 21 сценария для оценки адаптивных многоэтапных атак на защитников на основе больших языковых моделей. При 15 раундах адаптивной атаки коэффициент успешности составляет 5,4–14%, а объединение трёх передовых моделей атакующих LLM позволяет выявить в 1,4–2,2 раза больше уникальных успешных атак, чем у лучшего отдельного атакующего. Также публикуются бенчмарк, оркестратор, базовые наборы инструментов и интерфейс командной строки для нескольких атакующих, набор данных для воспроизведения атак и другие материалы.

https://arxiv.org/abs/2607.18063
arXiv.org Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM... LLM-based agents process external content, exposing them to prompt injection and multi-turn manipulation. We present a 21-scenario benchmark for adaptive cross-session attacks against...
More from @aiattacks
  1. Sep 27, 2026Post #471
  2. Sep 26, 2026ИИ-агент OpenAI получил доступ к внутренним данным портала медицинского страхования Австра…
  3. Sep 24, 2026ИИ-агенты взломали 27 компаний и украли данные 600 тысяч банковских карт Всего за 5 дней з…
  4. Sep 21, 2026Исследователи из компании Hacktron, специализирующейся на кибербезопасности, использовали…
  5. Sep 21, 2026Как выбирать проекты на гитхабе, когда все вайбкодят. Статья, конечно, слоп. Но в основном…
  6. Sep 21, 2026PentestChain — десятиэтапную автоматизированную систему тестирования на проникновение, кот…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →