Claude 5 не взламывается? Один новый attack chain показывает, почему с AI-агентами всё сложнее
Anthropic показала 0 успешных prompt injection из 720 тестовых запусков и заявила, что Opus 5 стало крайне сложно пробить. А потом Йоханн Рехбергер собрал новую цепочку атак для Claude Code Auto Mode и в своих экспериментах получил 60–80% успешных запусков для отдельных вариантов.
⏺В статье разбирают, почему 0/720 не означает, что пространство атак стало нулевым, как работают PI probe и классификатор Auto Mode, и где именно ломается такая модель защиты. Главное здесь не сама prompt injection, а агент, у которого есть доступ к файлам, командам и сети: новая цепочка может обойти проверки, которых просто не было в исходном бенчмарке.
↪️ Читать статью
Бункер Хакера | Zeroday | #Статья
Post #2401
961

- ❤ 3