Лучший coding-агент провалил 76% реальных задач
Новый бенчмарк τᵗ-bench проверяет не просто генерацию кода, а весь процесс разработки AI-агента для клиента.
Модель получает:
— разрозненные данные компании;
— существующий код и API;
— требования клиента;
— ограничения по бюджету;
— неизвестные заранее пользовательские сценарии.
Лучший результат показала связка Claude Opus 5 + Claude Code — всего 23,9% успешно пройденных симуляций. Эталонные решения экспертов набрали 82,2%.
Большинство ошибок оказалось связано не с написанием кода. Агенты поверхностно изучали данные, почти не задавали уточняющих вопросов, выбирали знакомую архитектуру и писали тесты, которые не замечали собственных ошибок.
Показательная цифра: решения без вопросов клиенту набирали в среднем 0,16, а с четырьмя и более вопросами — 0,50.
Вывод: улучшать только генерацию кода недостаточно. Coding-агенты должны уметь выяснять требования, сравнивать архитектуры, учитывать стоимость и находить собственные ошибки до запуска.
https://arxiv.org/abs/2609.04611
Post #1480
839

- ❤ 6
- 👍 2