Кринж-METR 2/2
10 июля 2025 года METR выпускает новое исследование «Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity».
И какая же суматоха началась в кругу разработчиков. Лично мне не меньше двух десятков раз приводили это исследование как доказательство того, что agentic coding не работает.
Что же, теперь я знаю, кто читает только заголовки новостей:)
А заголовки были громкими:
• «Использование искусственного интеллекта замедляет опытных разработчиков на 19%»
• «AI замедляет разработчиков, но они думают, что ускоряет»
• «Ловушка продуктивности: почему ваши инженеры замедляются»
В моменте интернет просто заполонили такие статьи, а с ними появилась и куча разговоров о том, что агентная разработка неэффективна, вайб-кодинг умер, не успев родиться, и так далее. Я до сих пор слышу отголоски этой, без сомнений, гениальной работы.
Но да ладно, хватит глумиться. Что мы имеем по факту:
1. В исследовании приняли участие всего 16 разработчиков.
2. Сколько времени займёт задача, оценивали сами разработчики (я думаю, вы прекрасно и без меня знаете, насколько точны эти оценки).
3. Большинство разработчиков ни разу не пользовались Cursor. Более того, им приходилось постоянно переключаться между Cursor и JetBrains IDE, в связи с чем они теряли фокус (тогда ещё не было всего того зоопарка агентов, который есть сейчас).
4. Всего разработчики должны были решить 256 задач (половину без AI, половину с AI), но на запись попали только 128 задач, из которых из-за читерства (использования AI там, где это было запрещено) исключили 54 задачи. Итого исследование строили на результатах всего 74 задач.
5. Сами разработчики заявили, что они ускорились на ~20%. METR заявили, что они замедлились на ~19%.
Это не исследование — это absolute cinema.
Боже, вы не представляете, как я смеялся, когда читал его. Что-то более абсурдное сложно придумать. Правда, ещё смешнее было слушать людей, которые с серьёзным лицом рассказывали мне о том, насколько agentic coding неэффективен, приводя это исследование в качестве доказательства.
Но если вы подумали, что это всё, то спешу вас обрадовать! METR что-то заmeрили, что-то отmeрили, что приmeрили и привезли нам новую пачку анекдотов.
24 февраля 2026 года они выпустили новость о том, что решили повторить своё исследование на разработчиках, но уже с новыми моделями. Правда, у них ничего не получилось, потому что разработчики просто отказались писать код руками для исследования, из-за чего у них не получилось собрать контрольную группу.
Правда, это не помешало им сделать вывод, что модели замедляют разработчиков в среднем на 4%. Genius.
В общем, исследования от METR — это как высказывания Элиезера Юдковского: в них много хайпа, но мало смысла.
Я призываю вас не верить абсолютно всему, что выпускает эта контора, потому что у них нет цели провести качественные, независимые исследования, но есть цель создать исследования, которые создадут как можно больше шуму вокруг их компании.
Post #102
601
- 👍 12