ИИ-агенты для генерации кода решили лишь 41% задач в новом тесте
ИИ-агенты хорошо пишут код, но с по-настоящему сложными задачами всё ещё справляются не так хорошо.
Исследователи предлагают новый способ проверять такие системы: не на коротких починках, а на больших переделках кода, где нужно аккуратно менять сразу много частей и ничего не ломать. Команда специально отобрала реальные задачи, переписала их описания ясным языком и вручную проверила проверки, чтобы те не отсеивали верные ответы и не требовали того, чего не было в условии.
В этом обзоре разбираем, почему старые способы оценки ИИ для кода дают слишком красивую картину и что показывает новая проверка о реальных возможностях таких агентов.
📜 Полный обзор
Post #205
87