Агенты на основе большой языковой модели (LLM) эволюционируют из пассивных генераторов текстов в автономные системы, способные планировать, использовать инструменты, извлекать данные, получать доступ к памяти, взаимодействовать с окружающей средой и сотрудничать с несколькими агентами. Эти возможности расширяют автономность агентов, но в то же время усложняют проверку, отладку и аудит их поведения. Точность конечного ответа сама по себе не может объяснить, как был получен результат, какие доказательства подтверждают каждое утверждение, были ли оправданы вызовы инструментов, как память повлияла на последующие решения и в чем причина сбоев. В этом исследовании мы рассматриваем отслеживание доказательств и происхождение выполнения как основу подотчетности на уровне процессов в доверенных агентах на основе больших языковых моделей. Мы определяем происхождение выполнения как типизированный граф выполнения агента, а отслеживание доказательств — как его проекцию на отношения между доказательствами и их поддержкой. Этот подход объединяет в единую систему обоснование восстановления, поддержку утверждений, безопасность использования инструментов, отслеживание происхождения данных в памяти, наблюдаемость, отладку, аудит и восстановление. Мы представляем таксономию, охватывающую источники трассировки, доказательства и исполнительные единицы, отношения происхождения, степень детализации и время трассировки, формы представления и функции доверия. Затем мы рассмотрим ключевые методологические направления, в том числе представление провенанса, атрибуцию доказательств, провенанс использования инструментов, средства защиты во время выполнения, память, содержащую провенанс, наблюдаемость и диагностику сбоев. Наконец, мы обсудим эталонные показатели, наборы данных, метрики и нерешенные проблемы, связанные с созданием агентных систем, учитывающих провенанс, проверяемых и восстанавливаемых.
https://arxiv.org/abs/2606.04990
Post #441
117