TGViewer
Анализ данных (Data analysis) Анализ данных (Data analysis) @data_analysis_ml · 50.6K subscribers
Post #5730 4.48K
⚡️ ИИ-агенты хорошо проходят короткие тесты, но ломаются на длинных задачах

Инженер Microsoft AI протестировал девять моделей на 10 664 многошаговых запусках. Чем больше зависимых действий требовалось выполнить, тем ниже становилась итоговая надёжность: ошибка на одном этапе влияла на все последующие.

На ToolQA модели, показывавшие почти 100% на двух-четырёх шагах, к 16 шагам сохраняли лишь 0–33% успешных выполнений.

Сокращение контекста не помогло, а ускорило падение качества: агент терял историю собственных решений.

Авторы рекомендуют тестировать агентов на реальной длине рабочих сценариев, измерять надёжность каждого шага и добавлять промежуточные проверки.

Исследование:
https://arxiv.org/abs/2609.01660

Код и данные:
https://github.com/shubmittal/agent-horizon-degradation
  • 🔥 14
  • 👍 8
  • ❤ 7
More from @data_analysis_ml
  1. Sep 22, 2026Один вечер — много возможностей! ⚡️ 25 сентября у тебя будет шанс познакомиться сразу с че…
  2. Sep 22, 2026Xiaomi представила MiMo-V2.6 с открытыми весами 👀 В семейство вошли две MoE-модели: - Fla…
  3. Sep 21, 2026⚡️OpenAI заявила о решении более 100 открытых задач по математике 🤯 28 августа OpenAI нач…
  4. Sep 21, 2026В любом случае, Claude забанил мне два аккаунта, я ставлю на победу Альтмана!
  5. Sep 21, 2026🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно тер…
  6. Sep 21, 2026«Я хочу отправить их в тюрьму»: по данным Politico, Трамп произнёс это во время конфликта…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →