По мере того, как LLM превращаются в автономных агентов с возможностями использования инструментов, они создают проблемы безопасности, которые выходят за рамки традиционных проблем безопасности LLM, основанных на контенте. В этой статье представлена Sequential Tool Attack Chaining (\STAC) — новая многоэтапная система атак, использующая инструменты, которыми пользуются агенты. \STAC объединяет в цепочку вызовы инструментов, каждый из которых по отдельности кажется безобидным, но в совокупности позволяет выполнять вредоносные операции, которые становятся очевидными только на последнем этапе выполнения. В основе \STAC лежит автоматизированный конвейер с замкнутым циклом, который синтезирует исполняемые многоэтапные цепочки инструментов, проверяет их путем выполнения в среде и реконструирует скрытые многоэтапные запросы, которые надежно побуждают агентов выполнять проверенную вредоносную последовательность. Используя этот фреймворк, мы генерируем и систематически оцениваем 483 случая \ STAC, включающих 1352 набора взаимодействий пользователя, агента и среды и охватывающих различные домены, задачи, типы агентов и 10 режимов отказа.
https://arxiv.org/abs/2509.25624
Post #369
156