😎 У сильного AI-агента 40% запросов вообще не доходили до LLM
2 сентября Google разобрала лучшие решения международного AI Agents Challenge. Один из участников обнаружил, что основную часть бюджета съедают не сложные задачи, а запросы вроде «где мой заказ» и «отмени запись».
Перед полноценным агентом поставили трёхступенчатый маршрутизатор:
🔘 регулярные выражения обрабатывают очевидные команды без токенов;
🔘 спорные случаи классифицирует дешёвая модель, получающая всего 10 токенов;
🔘 только действительно сложные запросы доходят до большой рассуждающей модели.
По измерениям команды, первый детерминированный слой самостоятельно обработал более 40% входящих сообщений.
Вывод: оптимизацию агентной системы стоит начинать не с квантования и поиска модели подешевле, а с распределения запросов по сложности. Часто значительную часть трафика можно закрыть обычным кодом — быстрее, дешевле и предсказуемее.
Цифра основана на данных самого участника конкурса, а не на независимом сравнении. Но архитектурный приём универсален: сначала дешёвая проверка, потом классификация и лишь затем дорогая LLM.
Пруф: разбор Google от 2 сентября 2026 года
#aiagents #modelrouting #llmops #inference #costoptimization #agentarchitecture
@data_engi
Post #1318
152