Уже почти год сражаюсь с рецензентами Communications of the ACM и уверен, что лучше этой версии не напишу. Пока рецензенты докапываются до формы, суть статьи рискует растерять новизну. Поэтому даже если им опять что-то не понравится, переделывать ничего не хочу — решил опубликовать препринт.
Подтолкнул меня к этому сегодняшний разбор свежего отчёта DX Q2 2026. Судя по цифрам, объём AI-сгенерированного кода превысил 50%, медианный размер PR вырос на 64%, а расходы на ИИ скакнули с $1.5 тыс. до $44 тыс. за год. При этом доверие к изменениям упало, доля инноваций не выросла, а сэкономленное время поглотили ревью и CI/CD. Индустрия производит всё больше кода, но доверия к нему становится только меньше. В посте отлично разобрана диагностика проблемы, однако индустриальных протоколов её решения всё ещё нет. Во всяком случае в публичном поле.
А это именно то, о чем моя статья. Когда ИИ генерирует патч, тесты, документацию и ревью-комментарии на основе пересекающейся информации, зелёные тесты и выросший coverage ничего не доказывают. Они лишь подтверждают соответствие собственным, возможно ошибочным, предположениям модели. Возникает artifact inflation. Количество объектов в Pull Request растет, остаточный риск не снижается. При этом нагрузка на команду остаётся прежней.
В статье я предлагаю правило допуска для рискованных изменений. Оценка должна вестись не по количеству сгенерированных строк, а через assurance density. Этот показатель должен отражать, насколько пакет изменений действительно покрывает заявленные риски и снижает неопределенность, не раздувая при этом ресурсы на ревью и поддержку.
Сразу оговорюсь, что это opinion-статья. В ней нет эмпирической валидации или метрик с продакшена. Но это и не голословная демагогия — концепция опирается на строгий формальный аппарат assurance cases, чтобы дать индустрии рабочий язык и конкретные правила до того, как проблема окончательно выйдет из-под контроля.
Собственно, препринт.
Post #30
1.34K