🧠 ИИ лучше улучшает агентов, когда развивает несколько специализаций
Исследователи предложили новый подход к оптимизации harness: кода вокруг LLM, который управляет инструментами, поиском информации и проверкой ответов.
Обычно ИИ переписывает эту обвязку и оценивает версии на одном наборе задач. Но полезная специализация может потеряться, если проигрывает по общему баллу.
Авторы разделили поиск на две ветки:
• Каждая сохраняет задачи, с которыми справляется лучше другой.
• Ведёт собственные заметки об удачных изменениях.
• Развивает свою стратегию решения.
В математике одна ветка сосредоточилась на проверке ответов, другая на построении полных решений. Затем роутер выбирает подходящую обвязку для каждой новой задачи.
📈 На олимпиадной математике с Gemini 3 Flash точность выросла с 46% до 62%. Это +16 процентных пунктов. Подход превзошёл исходный метод во всех четырёх проверенных сочетаниях моделей и бенчмарков, хотя расход токенов был выше.
Практическая идея: при автоматической настройке агентов стоит сохранять несколько сильных специализаций и подбирать их под задачу.
📄 Исследование: https://arxiv.org/abs/2609.37834
Post #3065
1.58K

- 👍 8
- 🔥 5
- ❤ 2
- 💘 1