тест из 21 сценария для оценки адаптивных многоэтапных атак на защитников на основе больших языковых моделей. При 15 раундах адаптивной атаки коэффициент успешности составляет 5,4–14%, а объединение трёх передовых моделей атакующих LLM позволяет выявить в 1,4–2,2 раза больше уникальных успешных атак, чем у лучшего отдельного атакующего. Также публикуются бенчмарк, оркестратор, базовые наборы инструментов и интерфейс командной строки для нескольких атакующих, набор данных для воспроизведения атак и другие материалы.
https://arxiv.org/abs/2607.18063
Post #367
158