Исследование показало, что агенты могут радикально менять стратегию даже при идентичном вводе — и это напрямую снижает точность их работы
Группа исследователей в области обработки естественного языка из нескольких американских университетов провела совместное исследование, в ходе которого выяснилось, что агенты часто выбирают разные последовательности действий даже при идентичных входах. И это влияет на точность ответа.
Всего было проведено 3 000 экспериментов (100 задач × 10 запусков × 3 модели) на трёх моделях (Llama 3.1 70B, GPT-4o, Claude Sonnet 4.5) с использованием датасета HotpotQA.
В среднем исследователи зафиксировали 2,0–4,2 уникальных траектории на 10 запусков, а разброс по количеству шагов достигает 55%.
Высокая согласованность поведения (≤2 уникальных траектории) приводит к точности 80–92%, тогда как при высокой вариативности (≥6 траекторий) точность падает до 25–60%. Причём 69% расхождений возникают уже на втором шаге — при первом запросе. Длина траектории также коррелирует с точностью: короткие (3 шага) дают 90% правильных ответов, длинные (8+ шагов) — лишь 43%.
Работа подчёркивает: даже при минимальном наборе инструментов агенты демонстрируют значительную вариативность, а с ростом сложности задач проблема только усугубляется. Для практических применений важно не только повышать точность, но и обеспечивать стабильность поведения — это позволит строить более надёжные и предсказуемые системы.
https://arxiv.org/html/2602.11619v1
Post #3583
1.85K
- 👍 5
- 🤔 3
- 🤝 2