TGViewer
Плохой менеджер Артём Арюткин Плохой менеджер Артём Арюткин @badtechproject · 14.2K subscribers
Post #1755 4.62K
AI и 100 тыс. разработчиков в исследованиях от Егора Денисова

Это исследование противоположно тому, что сделали в METR: тут наблюдали 100 тыс. разработчиков из 600 компаний.

Че по результатам?

AI действительно помогает, но не так, как нам обещали в промо-роликах. Средние +15–20% - это не революция. Всё упирается в зрелость кода, тип задач и размер вашей кодовой помойки.

Откуда я это все взял?
Посмотрел 20-минутное выступление Егора Денисова-Бланша из Stanford - и это, пожалуй, один из самых аккуратных, честных и приземлённых разборов реальной продуктивности инженеров под воздействием LLM.

1. Почему все предыдущие замеры продуктивности - так себе авантюра?
Потому что:
1) Исследования финансируют сами вендоры.
OpenAI и прочие ребята очень стараются показать, что вырастили «+как минимум 2x productivity». Но выборка перекошена, метрики подкрашены - всё как обычно.

Ну вы же сами работаете в корпорациях, не мне вам рассказывать)))

2) Коммиты и PR - плохая метрика.
Бум output, но линия качества - вниз.
Можно удвоить количество строк кода, не трогая полезность ни на йоту.
3) Greenfield-эффект.
На игрушечных проектах LLM выглядит богом.
А в реальной компании 90% задач - это старый код, грязь, зависимости и боль. Ну и куча требований безопасности, надежности.

4) Опросы?
«Кажется, я стал продуктивнее» ≠ «стал».
Самооценка - круто для well-being, но не для метрик.

Это ваще супер важная штука, когда регулярно занимаешься DevEx понимаешь, что есть большая разница между реальной производительностью и тем, как она ощущается. По сути, тут совпадает с ощущением многозадачности, как у менеджера: весь день делал кучу вещей, вроде, молодец, но есть ли результат?


2. Как Стэнфорд это мерил?
1) Подключили настоящие git-репы компаний.
Не игрушки, а живой корпоративный код.
Контекст команд - сохранён.
2) Собрали пул архитекторов и заставили их руками ставить оценки.
10–15 экспертов на качество, сложность, поддерживаемость.
И оценки очень хорошо коррелировали - то есть разметка надёжная.
3) Натренировали ML-модель, чтобы она воспроизводила экспертную оценку.
С высокой корреляцией.
То есть дальше можно масштабировать без сумасшедшей стоимости ревью.
4) Классифицировали типы изменений:
- добавление фичи
- удаление
- рефакторинг
- rework (переделка свежего кода) ← важный индикатор «кажется, ИИ ошибся, давайте исправим».
5) Прогнали всё ретроспективно за 2019–2025.
От COVID до появления LLM - чёткое сравнение «до» и «после».

3. Что показало исследование? Здесь многие ахнут
1) Сырой прирост кода: +30–40%.
Но туда же входит и мусор.
2) Реальная продуктивность: +15–20%.
После вычета багфиксов и rework.
И это среднее - иногда намного хуже.
3) На сложных задачах: почти ноль.
И огромная дисперсия.
Иногда AI даже замедляет.
4) Картинка в начаое поста хорошо иллюстрирует это: сложность × зрелость проекта

5) Язык имеет значение.
Популярные - выиграли.
Эзотерика - страдает, потому что моделей просто не на чем было учить.
6) Размер репозитория работает против вас.
Рост выгоды падает логарифмически.
Причины: шум, coupling, ограничения контекста.
Чем больше кодовая база - тем хуже LLM понимает, «что тут вообще происходит».

Тут ожидаемый эффект, конечно)

4. Че делать то, со всем этим?
1) Определите сложность типовых задач и зрелость своего проекта.
Если у вас legacy-монолит - чудес не будет.
2) Используйте популярные технологии.
LLM по ним лучше обучены → подсказки лучше.
3) На больших старых системах начинайте с пилота.
Маленький модуль, короткий эксперимент.
«Из коробки» Cursor или Copilot может не давать прироста.
4) Следите за долей rework.
Если вдруг резко вырос объём кода - это не рост продуктивности, а рост переделок.
Мы, кстати, часто такое обсуждаем а ребятами, потому что рост объема кода, это, конечно, скорее вред.


5) Комбинируйте количественные сигналы git с качественным ревью.
Не сводите всё к «команда довольна/недовольна».

А вот тут по ссылочке можно найти презу.

А у вас в компании как с AI в разработке?
🔥 - активные эксперименты и уже многое в проде
🦄 - пробуем тестируем, но не активно и не верим
💊 - мы явно на другом уровне
  • 🔥 21
  • 👍 12
  • 💊 11
  • 🦄 10
  • ❤ 4
More from @badtechproject
  1. Sep 25, 2026ПЯТНИЧНОЕ Когда эксперимент оказался слишком успешным 🙂 Всем отличных выходных! 💬 ПРО ПР…
  2. Sep 25, 2026#пятничное
  3. Sep 24, 2026Ситуация в индустрии напоминает написание кандидатской по какой-то части теоретической физ…
  4. Sep 24, 2026С днем системного аналитика, друзья😉
  5. Sep 24, 2026Почему AI «плохая» технология Ваще, я технологический оптимист, как можно заметить по блог…
  6. Sep 23, 2026Post #2197
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →