Агенты на основе больших языковых моделей (БЯМ) все чаще применяются для тестирования на проникновение, но мы по-прежнему мало знаем о том, на что они способны и почему могут давать сбой. Мы сравнили две системы на основе PentestGPT: старую систему с участием человека, работающую на легковесной модели Kimi K2.5, и новую автономную систему, работающую на Claude Opus 4.8. Автономная система справилась со всеми тремя общедоступными задачами, в том числе с двумя, которые старая система так и не решила. Результат старой системы оказался более неожиданным. Даже на тех машинах, с которыми не справляется устаревшая система, она выполняет около половины подзадач, работая на обычных университетских графических процессорах без ограничений со стороны провайдера. Мы можем описать эту тенденцию, но не объяснить ее, поскольку модель, инструментарий, автономность и архитектура памяти меняются одновременно. Эта тенденция по-прежнему указывает на следующий вопрос: что будет ограничивать этих агентов по мере того, как они будут браться за более сложные задачи? Обычно в качестве ответа приводят проблему долговременной памяти — потерю доступа к более ранним результатам в ходе длинных цепочек атак. Мы протестировали это, добавив в обе системы уровень памяти с охватом, но это не улучшило результаты. Судя по остановкам в работе, которые мы могли проанализировать, ограничивающим фактором было скорее планирование и вовлеченность, чем потеря памяти: агенты сохраняли доказательства для дальнейшего продвижения, но так и не превращали их в конкретную гипотезу для эксплуатации уязвимостей. Это может свидетельствовать о том, что наступательный потенциал будет расти по мере того, как агенты научатся планировать, а не благодаря улучшению памяти. Те же подсчеты по подзадачам, которые отслеживают этот потенциал, доступны и для защитников, которые могут оценивать его по мере роста, а не ждать, пока он проявится в реальных условиях
https://arxiv.org/abs/2609.10780
Post #439
123