TGViewer
PWN AI PWN AI @pwnai · 7.31K subscribers
Post #1239 2.4K
За последние полтора года появилось очень много интересных статьей, которые дают ответ на вопрос "а как вообще ломать агентов", но на практике. Кодовые и саморазвивающиеся, работающие в браузере и локально. Этого реально много и обозревать каждую статью по отдельности – не имеет смысла. Так как часто векторы эксплуатации сводятся к одним и тем же фундаментальным проблемам: чрезмерному доверию к контексту, манипуляциям с тулзами или непрямыми инъекциями.

Но когда кто-то собирает весь этот хаос и боевую фактуру в одном месте - отличный материал для анализа. Репозиторий ai-agent-hacking-writeups от shoebpate1 как раз такая база.

Внутри нет рассуждений об этике ИИ, только техническая фактура. В репе показано, как пробиваются песочницы и как атакующие выходят на RCE через стандартный функционал агента. Приведено много интересных публикаций: агент получает доступ к тулзам, ловит кривой контекст и сам же радостно дергает внутренние API или сливает креды. Отдельный интерес представляют разборы косвенных промпт атак, когда модель молча цепляет полезную нагрузку из подсунутого PDF или парсит мусорный сайт, сразу теряя цель и передавая контроль злоумышленнику.

Изучать чужие райтапы полезно.
More from @pwnai
  1. Sep 14, 202610 сентября Anthropic опубликовала Detecting and countering misuse of AI — отчёт о злоупот…
  2. Sep 12, 2026Post #1242
  3. Sep 6, 2026Фанфакты: Однажды ночью эта атакующая штука снесла мне ось с компа) ну я там ничего не хра…
  4. Sep 6, 2026Я уже неделю участвую в новом соревновании от GraySwan - Hazard Hunt, в категории Cyber. У…
  5. Aug 23, 2026Post #1238
  6. Aug 22, 2026Харнесс, оптимизации, токенмаксинг и скиллы для кодекса - все эти выражения я стал слышать…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →