🧠 Google представила BATS - Budget Aware Test-time Scaling
Идея простая и очень показательная: давать агенту больше tool calls часто бесполезно, потому что агент не осознаёт, что у него ещё остался бюджет.
В итоге он:
- либо думает, что уже знает ответ
- либо считает, что зашёл в тупик
и останавливается раньше времени, даже если лимит на инструменты ещё есть.
Как это работает обычно:
ReAct-агенты чередуют «размышление» и «действие», где действие — это Search, Browse и другие tool calls. Лимит на инструменты — жёсткий потолок внешних доказательств.
Проблема:
Агенты упираются в performance ceiling, потому что не адаптируют стратегию под оставшийся бюджет.
Решение BATS начинается с простого — Budget Tracker:
- агент постоянно видит счётчик вроде
«Query budget remaining»
«URL budget remaining»
- и меняет поведение в зависимости от остатка бюджета
Результат:
С Budget Tracker агент на Gemini-2.5-Pro достигает сопоставимой точности с 10 tool calls, тогда как ReAct требует 100.
При этом:
- на 40.4% меньше search-запросов
- на 21.4% меньше browse-запросов
- на 31.3% ниже общая стоимость
Но BATS идёт дальше:
- строит budget-aware план
- добавляет self-check шаг — продолжать копать текущую гипотезу или переключиться на новую
Метрики:
На BrowseComp (100 tool calls):
- BATS + Gemini-2.5-Pro: 24.6%
- ReAct: 12.6%
Также улучшения на:
- BrowseComp-ZH: 46.0% vs 31.5%
- HLE-Search: 27.0% vs 20.5%
И всё это без task-specific обучения.
Важный момент:
Авторы вводят единую метрику стоимости - суммируют цену токенов и tool calls. Оценивается не только точность, но и деньги.
Будущее агентных систем - не в увеличении лимитов, а в осознанном управлении бюджетом и стратегией поиска.
arxiv.org/abs/2511.17006
Post #1297
1.71K

- ❤ 4