TGViewer
Concise Research Concise Research @c_research · 1.25K subscribers
Post #283 857
ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration
[код, веса]

Исследователи из NVIDIA и Университета Гонконга (HKU) поднимают проблему агентного оркестрирования. Современные мультимодальные агенты (например, в Humanity's Last Exam) строятся по принципу монолита: одна огромная LLM (как GPT-4o или Claude) пытается решить задачу самостоятельно, периодически дергая базовые тулы вроде поиска или интерпретатора кода.

Авторы говорят: это не эффективно и дорого. Намного лучше работает другой подход — небольшая (8B) модель-оркестратор, которая управляет целым парком инструментов. В этот набор инструментов входят не только калькуляторы и поиск, но и другие специализированные и общие LLM (от Qwen-Coder до GPT-5).

То есть, маленькая LLM решает, когда задачу можно решить дешевым локальным поиском, а когда нужно позвать GPT-5 или специализированную математическую модель.

Метод

Авторы обучают модель Orchestrator-8B (на базе Qwen3-8B) с помощью метода ToolOrchestra в парадигме Perception-Reasoning-Action.

При этом, если просто взять готовую LLM и попросить её выбрать нужную модель-инструмент (через промпт), она ведет себя предвзято:

➡️Self-enhancement bias: Qwen будет вызывать другие модели Qwen.
➡️Other-enhancement bias: GPT-5 будет в 98% случаев вызывать GPT-5-mini или себя же, игнорируя стоимость и наличие других, не менее подходящих моделей.

Чтобы научить 8B-модель быть хорошим менеджером, её обучают с помощью GRPO. Reward строится не просто на правильности ответа, а как взвешенная сумма трех компонентов:

➡️Outcome: решена ли задача в итоге (судит GPT-5).
➡️Эффективность: штрафы за стоимость вызванных моделей (по реальным API-ценам) и за задержку (latency).
➡️Пользовательские предпочтения: вектор предпочтений, описывающий, насколько пользователю критична цена, приватность (локальный поиск vs web) или скорость.

Для обучения авторы собрали синтетический датасет ToolScale. Пайплайн его создания включает симуляцию баз данных, генерацию API и синтез сложных многошаговых задач с эталонными траекториями решений, валидированными LLM.

Результаты

На Humanity's Last Exam Orchestrator-8B обходит GPT-5 с тулами и огромную Qwen3-235B. На бенчмарке FRAMES (поиск и рассуждения по Wikipedia) выдает 76.3%.

По эффективности (τ-Bench) тоже лучше. Агент успешно решает сложные задачи, используя GPT-5 только в 40% шагов для самых трудных подзадач, а для остального обходясь дешевыми моделями. В итоге стоимость и задержка снижаются в 3 раза по сравнению с использованием только GPT-5.

Модель тестировали на невиданных при обучении тулах (например, Claude Opus 4.1 или новые модели Qwen). Orchestrator-8B успешно адаптировался: читая описания новых моделей, он корректно встраивал их в процесс, снова показывая лучшее соотношение цена/качество.

Отдельно проверили, как модель слушается юзера. Если пользователь пишет "Я хочу избежать API-колов и ограничиться локальным поиском/хостингом", Orchestrator-8B перестраивает логику и почти не обращается к GPT-5 или веб-поиску, справляясь силами локальных моделей.

Вместо вывода

Работа предлагает прагматичный взгляд на развитие AI-агентов. Вместо бесконечного раздувания размеров монолитных моделей, будущее может лежать в разделении труда: легкий, дешевый, но очень умный в менеджменте координатор управляет зоопарком специализированных экспертов.
  • 👍 5
  • ❤ 3
  • 🤔 2
More from @c_research
  1. Aug 4, 2026Наука или инженерия Мысли после ICML'26 [2/2] В первой части обсуждали критерии научности…
  2. Aug 3, 2026Наука или инженерия Мысли после ICML'26 [1/2] Не важно ходишь ли по постерам в Сеуле или п…
  3. Jul 14, 2026Рассказываем о новой unified-модели в Alice AI С недавних пор в Алисе AI и Шедевруме появи…
  4. Jul 7, 2026ICML’26 Зачем ездить на конференции? Конечно, чтобы презентовать свои статьи и читать чужи…
  5. Jul 3, 2026Агентская мультимодалка спустя те же 14 месяцев: закрыли ли разрыв, который не закрыла уни…
  6. Jul 2, 2026Унифицированная мультимодалка спустя 14 месяцев: где обещанная синергия? В мае 2025 BAGEL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →