Авторы работы *Diving into Reliable Self-Evolving Agents* систематизировали исследования по агентам, которые умеют менять собственные промпты, память, инструменты, стратегии и даже части архитектуры.
Внутри сразу несколько полезных вещей:
* taxonomy уровней эволюции от L0 до L4;
* reliability ladder для проверки того, можно ли доверять очередному self-update;
* открытый каталог из 549 работ по теме;
* разбор того, какие доказательства вообще нужны, чтобы считать новую версию агента лучше предыдущей.
Особенно важный принцип:
обновление не должно само контролировать единственное доказательство собственной успешности.
Если агент изменил себя, а затем сам же решил, что стал лучше, это почти ничего не доказывает. Нужна независимая проверка: внешние evals, отдельный verifier, контрольные среды или другие механизмы, которые сам update не может подменить.
📄 Paper:
https://openreview.net/forum?id=CGO1hDTHNe🌐 Project:
https://wkqdzkd.github.io/Awesome-Reliable-Self-Evolving-Agents/💻 GitHub:
github.com/wkqdzkd/Awesome-Reliable-Self-Evolving-Agents#AI #Agents #SelfEvolvingAgents #LLM #Research
