Это исследование противоположно тому, что сделали в METR: тут наблюдали 100 тыс. разработчиков из 600 компаний.
Че по результатам?
AI действительно помогает, но не так, как нам обещали в промо-роликах. Средние +15–20% - это не революция. Всё упирается в зрелость кода, тип задач и размер вашей кодовой помойки.
Откуда я это все взял?
Посмотрел 20-минутное выступление Егора Денисова-Бланша из Stanford - и это, пожалуй, один из самых аккуратных, честных и приземлённых разборов реальной продуктивности инженеров под воздействием LLM.
1. Почему все предыдущие замеры продуктивности - так себе авантюра?
Потому что:
1) Исследования финансируют сами вендоры.
OpenAI и прочие ребята очень стараются показать, что вырастили «+как минимум 2x productivity». Но выборка перекошена, метрики подкрашены - всё как обычно.
Ну вы же сами работаете в корпорациях, не мне вам рассказывать)))
2) Коммиты и PR - плохая метрика.
Бум output, но линия качества - вниз.
Можно удвоить количество строк кода, не трогая полезность ни на йоту.
3) Greenfield-эффект.
На игрушечных проектах LLM выглядит богом.
А в реальной компании 90% задач - это старый код, грязь, зависимости и боль. Ну и куча требований безопасности, надежности.
4) Опросы?
«Кажется, я стал продуктивнее» ≠ «стал».
Самооценка - круто для well-being, но не для метрик.
Это ваще супер важная штука, когда регулярно занимаешься DevEx понимаешь, что есть большая разница между реальной производительностью и тем, как она ощущается. По сути, тут совпадает с ощущением многозадачности, как у менеджера: весь день делал кучу вещей, вроде, молодец, но есть ли результат?
2. Как Стэнфорд это мерил?
1) Подключили настоящие git-репы компаний.
Не игрушки, а живой корпоративный код.
Контекст команд - сохранён.
2) Собрали пул архитекторов и заставили их руками ставить оценки.
10–15 экспертов на качество, сложность, поддерживаемость.
И оценки очень хорошо коррелировали - то есть разметка надёжная.
3) Натренировали ML-модель, чтобы она воспроизводила экспертную оценку.
С высокой корреляцией.
То есть дальше можно масштабировать без сумасшедшей стоимости ревью.
4) Классифицировали типы изменений:
- добавление фичи
- удаление
- рефакторинг
- rework (переделка свежего кода) ← важный индикатор «кажется, ИИ ошибся, давайте исправим».
5) Прогнали всё ретроспективно за 2019–2025.
От COVID до появления LLM - чёткое сравнение «до» и «после».
3. Что показало исследование? Здесь многие ахнут
1) Сырой прирост кода: +30–40%.
Но туда же входит и мусор.
2) Реальная продуктивность: +15–20%.
После вычета багфиксов и rework.
И это среднее - иногда намного хуже.
3) На сложных задачах: почти ноль.
И огромная дисперсия.
Иногда AI даже замедляет.
4) Картинка в начаое поста хорошо иллюстрирует это: сложность × зрелость проекта
5) Язык имеет значение.
Популярные - выиграли.
Эзотерика - страдает, потому что моделей просто не на чем было учить.
6) Размер репозитория работает против вас.
Рост выгоды падает логарифмически.
Причины: шум, coupling, ограничения контекста.
Чем больше кодовая база - тем хуже LLM понимает, «что тут вообще происходит».
Тут ожидаемый эффект, конечно)
4. Че делать то, со всем этим?
1) Определите сложность типовых задач и зрелость своего проекта.
Если у вас legacy-монолит - чудес не будет.
2) Используйте популярные технологии.
LLM по ним лучше обучены → подсказки лучше.
3) На больших старых системах начинайте с пилота.
Маленький модуль, короткий эксперимент.
«Из коробки» Cursor или Copilot может не давать прироста.
4) Следите за долей rework.
Если вдруг резко вырос объём кода - это не рост продуктивности, а рост переделок.
Мы, кстати, часто такое обсуждаем а ребятами, потому что рост объема кода, это, конечно, скорее вред.
5) Комбинируйте количественные сигналы git с качественным ревью.
Не сводите всё к «команда довольна/недовольна».
А вот тут по ссылочке можно найти презу.
А у вас в компании как с AI в разработке?
🔥 - активные эксперименты и уже многое в проде
🦄 - пробуем тестируем, но не активно и не верим
💊 - мы явно на другом уровне
