Новости нейросетей. Open source модели и методы, AI-агенты, deep learning, big data, machine learning, NLP, computer vision.
По вопросам сотрудничества: @kekspeksoh
Post #1976
877

RRSI: метод рекурсивного самоулучшения обвязки ИИ-агентов от Google улучшил результаты Claude Opus 4.8 на всех бенчмарках
Исследователи из Google Cloud AI Research представили метод RRSI (Regularized Recursive Self-Improvement), который автоматически улучшает обвязку ИИ-агентов так, чтобы прирост сохранялся и на новых задачах. Обвязка - это всё, что окружает замороженную LLM: промпты, логика управления, инструменты, память и работа с контекстом. Метод полезен командам, которые строят агентов на закрытых моделях через API: веса таких моделей недоступны, поэтому качество агента поднимают через обвязку. Ещё он нужен тем, кто уже оптимизирует промпты и инструменты автоматически и видит, что прирост не переносится на новые задачи.
Обвязка ИИ-агента решает, какой файл прочитать перед правкой, как восстановиться после упавшей команды и что оставить в контексте. Регуляризация во время обучения мешает модели зазубривать обучающие данные, например, применяет штраф за слишком большие веса. RRSI применяет ту же идею к обвязке: менять можно всё, от промптов до субагентов, но избегает подгонки результатов под конкретный бенчмарк.
Существующие методы автоматической настройки обвязки почти не переносят прирост на новые задачи. С обвязкой RRSI агент на Claude Opus 4.8 стал лучше на всех восьми бенчмарках. На задачах, на которых настраивали обвязку, он прибавил от 1.1 до 6.0 пункта (на Terminal-Bench 2.1 с 74.2 до 80.2), а на пяти незнакомых бенчмарках от 1.8 до 4.7 пункта (на JobBench с 36.0 до 40.7). В офисных задачах средний результат на незнакомых бенчмарках вырос с 39.7 до 43.6 пункта, а на инженерном Frontier-Eng с 17.7 до 22.0, то есть на 24.3%. При этом обвязка RRSI экономнее: с ней агент тратит на одну задачу в среднем 2.42 млн токенов, а с обвязкой, настроенной без регуляризации, 3.80 млн.
Код опубликован на GitHub под лицензией Apache 2.0, журналы экспериментов выложены на странице проекта.
#Stateoftheart
Исследователи из Google Cloud AI Research представили метод RRSI (Regularized Recursive Self-Improvement), который автоматически улучшает обвязку ИИ-агентов так, чтобы прирост сохранялся и на новых задачах. Обвязка - это всё, что окружает замороженную LLM: промпты, логика управления, инструменты, память и работа с контекстом. Метод полезен командам, которые строят агентов на закрытых моделях через API: веса таких моделей недоступны, поэтому качество агента поднимают через обвязку. Ещё он нужен тем, кто уже оптимизирует промпты и инструменты автоматически и видит, что прирост не переносится на новые задачи.
Обвязка ИИ-агента решает, какой файл прочитать перед правкой, как восстановиться после упавшей команды и что оставить в контексте. Регуляризация во время обучения мешает модели зазубривать обучающие данные, например, применяет штраф за слишком большие веса. RRSI применяет ту же идею к обвязке: менять можно всё, от промптов до субагентов, но избегает подгонки результатов под конкретный бенчмарк.
Существующие методы автоматической настройки обвязки почти не переносят прирост на новые задачи. С обвязкой RRSI агент на Claude Opus 4.8 стал лучше на всех восьми бенчмарках. На задачах, на которых настраивали обвязку, он прибавил от 1.1 до 6.0 пункта (на Terminal-Bench 2.1 с 74.2 до 80.2), а на пяти незнакомых бенчмарках от 1.8 до 4.7 пункта (на JobBench с 36.0 до 40.7). В офисных задачах средний результат на незнакомых бенчмарках вырос с 39.7 до 43.6 пункта, а на инженерном Frontier-Eng с 17.7 до 22.0, то есть на 24.3%. При этом обвязка RRSI экономнее: с ней агент тратит на одну задачу в среднем 2.42 млн токенов, а с обвязкой, настроенной без регуляризации, 3.80 млн.
Код опубликован на GitHub под лицензией Apache 2.0, журналы экспериментов выложены на странице проекта.
#Stateoftheart
- 👍 3
- 🔥 3
- ❤ 1
- 🎉 1







