🖥 Google Research научила агентов улучшать собственную обвязку и не переобучаться
Google Research выложила RRSI (Regularized Recursive Self-Improvement of Agent Harnesses). Это метод, в котором агент сам дорабатывает свой «харнес»: промпты, логику управления, инструменты и память.
Если улучшать харнес на фиксированном наборе задач, он начинает подгоняться под тест. В RRSI пространство правок оставили открытым и вместо него регуляризуют сам процесс поиска.
Регуляризация идёт с двух сторон. При генерации правок действует затухающий бюджет на число изменений, генератор учитывает историю прошлых правок, а застрявшие запуски уводятся в неисследованные компоненты. При отборе критик отсеивает утечки, порог с учётом шума не пропускает мелкие случайные приросты, прирост должен окупать потраченные токены, а неиспользуемые компоненты удаляются.
Модель при этом заморожена, в экспериментах это Claude Opus 4.8, и улучшается только обвязка вокруг неё. Результаты: Terminal-Bench 2.1 с 74,2% до 80,2%, SWE-bench Verified с 82,0% до 83,8%, EngDesign с 50,0% до 54,9% и Harvey LAB с 89,4% до 90,5%.
Код открыт под Apache 2.0, в репозитории есть готовые адаптеры для кодинга, офисных задач и инженерии.
Статья: https://arxiv.org/abs/2609.24972
GitHub: https://github.com/google-research/rrsi
Post #5883
1.43K

- 🔥 11
- ❤ 8
- 👍 2
- ❤🔥 1