TGViewer
Бункер Хакера Бункер Хакера @book_academ · 21.4K subscribers
Post #2401 961
Claude 5 не взламывается? Один новый attack chain показывает, почему с AI-агентами всё сложнее

Anthropic показала 0 успешных prompt injection из 720 тестовых запусков и заявила, что Opus 5 стало крайне сложно пробить. А потом Йоханн Рехбергер собрал новую цепочку атак для Claude Code Auto Mode и в своих экспериментах получил 60–80% успешных запусков для отдельных вариантов.

⏺В статье разбирают, почему 0/720 не означает, что пространство атак стало нулевым, как работают PI probe и классификатор Auto Mode, и где именно ломается такая модель защиты. Главное здесь не сама prompt injection, а агент, у которого есть доступ к файлам, командам и сети: новая цепочка может обойти проверки, которых просто не было в исходном бенчмарке.

↪️ Читать статью

Бункер Хакера | Zeroday | #Статья
  • ❤ 3
More from @book_academ
  1. Sep 29, 2026Как удалить майнер, который не даёт даже открыть Диспетчер задач? На заражённом ПК обычное…
  2. Sep 28, 2026Authelia - единая точка входа для защиты веб-приложений Authelia ставит перед вашими веб-с…
  3. Sep 26, 2026Бункер Хакера | #мем
  4. Sep 25, 2026Чужой компьютер: почему ваш телефон вам не принадлежит Купили смартфон, поставили свою ОС,…
  5. Sep 24, 2026MCP как троянский конь: сторонний сервер может отравить ИИ-агента MCP подключает агента к…
  6. Sep 23, 2026CyberChef - швейцарский нож для работы с данными CyberChef - это веб-тул, который превраща…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →