Data science, наука о данных.
@haarrp - админ
РКН: clck.ru/3FmyAp
Post #5730
4.48K

⚡️ ИИ-агенты хорошо проходят короткие тесты, но ломаются на длинных задачах
Инженер Microsoft AI протестировал девять моделей на 10 664 многошаговых запусках. Чем больше зависимых действий требовалось выполнить, тем ниже становилась итоговая надёжность: ошибка на одном этапе влияла на все последующие.
На ToolQA модели, показывавшие почти 100% на двух-четырёх шагах, к 16 шагам сохраняли лишь 0–33% успешных выполнений.
Сокращение контекста не помогло, а ускорило падение качества: агент терял историю собственных решений.
Авторы рекомендуют тестировать агентов на реальной длине рабочих сценариев, измерять надёжность каждого шага и добавлять промежуточные проверки.
Исследование:
https://arxiv.org/abs/2609.01660
Код и данные:
https://github.com/shubmittal/agent-horizon-degradation
Инженер Microsoft AI протестировал девять моделей на 10 664 многошаговых запусках. Чем больше зависимых действий требовалось выполнить, тем ниже становилась итоговая надёжность: ошибка на одном этапе влияла на все последующие.
На ToolQA модели, показывавшие почти 100% на двух-четырёх шагах, к 16 шагам сохраняли лишь 0–33% успешных выполнений.
Сокращение контекста не помогло, а ускорило падение качества: агент терял историю собственных решений.
Авторы рекомендуют тестировать агентов на реальной длине рабочих сценариев, измерять надёжность каждого шага и добавлять промежуточные проверки.
Исследование:
https://arxiv.org/abs/2609.01660
Код и данные:
https://github.com/shubmittal/agent-horizon-degradation
- 🔥 14
- 👍 8
- ❤ 7















