Разработчики были уверены, что ИИ ускорил их на 20%. Замеры METR на реальных задачах показали обратное - минус 19% к скорости.
Испытуемые с доступом к ИИ-ассистентам (Cursor и аналоги) на реальных репозиториях работали медленнее, чем без них, но субъективно были убеждены в обратном. Разрыв между ощущением и фактом играет большую роль, если на этом ощущении строится решение сдавать код без дополнительной проверки.
Похожая картина и по качеству: по данным Opsera (2026), в ИИ-сгенерированных PR багов в 1,7 раза больше, а доля PR, принятых без правок, - 32,7% против 84,4% у код-ревью на человеческом коде.
Если автор кода ошибается в оценке собственной скорости на 19 п.п., то доверять его же самооценке качества кода не стоит.
Именно здесь и нужна независимая оценка: тестирование, которое проверяет результат, а не веру в результат 🔍
Post #1254
164

- 👍 3
- 💯 2