За последние полтора года появилось очень много интересных статьей, которые дают ответ на вопрос "а как вообще ломать агентов", но на практике. Кодовые и саморазвивающиеся, работающие в браузере и локально. Этого реально много и обозревать каждую статью по отдельности – не имеет смысла. Так как часто векторы эксплуатации сводятся к одним и тем же фундаментальным проблемам: чрезмерному доверию к контексту, манипуляциям с тулзами или непрямыми инъекциями.
Но когда кто-то собирает весь этот хаос и боевую фактуру в одном месте - отличный материал для анализа. Репозиторий ai-agent-hacking-writeups от shoebpate1 как раз такая база.
Внутри нет рассуждений об этике ИИ, только техническая фактура. В репе показано, как пробиваются песочницы и как атакующие выходят на RCE через стандартный функционал агента. Приведено много интересных публикаций: агент получает доступ к тулзам, ловит кривой контекст и сам же радостно дергает внутренние API или сливает креды. Отдельный интерес представляют разборы косвенных промпт атак, когда модель молча цепляет полезную нагрузку из подсунутого PDF или парсит мусорный сайт, сразу теряя цель и передавая контроль злоумышленнику.
Изучать чужие райтапы полезно.
Post #1239
2.4K
