TGViewer
Айра Монгуш — AI, tech & math Айра Монгуш — AI, tech & math @airamongush · 984 subscribers
Post #195 216
В июле 2025 года METR провела рандомизированный контролируемый эксперимент: 16 опытных разработчиков, 246 задач, данные февраля по июнь 2025 года, инструменты Cursor Pro с Claude 3.5 и 3.7 Sonnet. Результат дословно: разрешение использовать ИИ увеличило время выполнения на 19 процентов, с доверительным интервалом примерно от плюс 2 до плюс 39 процентов, при том что после эксперимента те же разработчики оценивали ускорение в 20 процентов. Один эксперимент не приговор, и сама METR отмечает, что это замер начала 2025 года. Но он показывает, как легко спутать ощущение ускорения с ускорением, и почему ощущения плохой измеритель.

4. Что говорят данные о темпе, и как их читать? METR измеряет временной горизонт задач: длину задачи по человеческому времени, которую модель решает с вероятностью 50 процентов. Этот горизонт удваивался примерно каждые семь месяцев в 2019 по 2025 годы, а на данных 2024 по 2025 удвоение выглядит ближе к четырём месяцам. Anthropic на странице When AI builds itself приводит именно эту ускоренную оценку и добавляет внутренние данные: более 80 процентов кода, вливаемого в кодовую базу Anthropic на май 2026 года, написано Claude, Anthropic а типичный инженер во втором квартале 2026 года вливал в 8 раз больше кода в день, чем в 2024 году Anthropic.

Строки кода это количество, а не качество, и Anthropic честно оговаривает, что величина 8x почти наверняка завышает реальный прирост продуктивности. Кривая METR очень чувствительна к нескольким длинным задачам, а человеческие базовые времена измерены лишь для малой части самых длинных задач. Но это не доказательство того, что машина сама выбирает направления исследований. Именно выбор целей Anthropic называет своим главным оставшимся разрывом.

И ещё один датапоинт против прямолинейной экстраполяции. Дэниел Кокотайло, ведущий автор сценария AGI 2027 (апрель 2025), к концу 2025 и в 2026 году сдвинул свою медиану ближе к 2029 и 2030 годам, потому что прогресс идет несколько медленнее сценария. Скептики вроде Эге Эрдиля и Тамая Бесироглу из Epoch AI держат горизонт AGI за 2045 годом и не считают интеллектуальный взрыв правдоподобным, хотя допускают взрывной экономический рост.

5. Что реально засчитывалось бы как доказательство? Нужен повторяемый рост исследовательской способности на протяжении нескольких поколений моделей, измеренный с учётом двух вещей: человеческого вклада и стоимости вычислений. Конкретно я бы смотрела на следующее:
- Растёт ли способность модели самостоятельно выбирать направления исследований, а не только исполнять поставленные эксперименты, ведь именно этот разрыв называет своим Anthropic.
- Сохраняется ли ускорение, когда вы фиксируете бюджет вычислений, а не наращиваете его.
- Держится ли эффект на нескольких поколениях подряд, а не на одном удачном релизе.
- Подтверждается ли он контролируемыми замерами вроде METR, а не опросами и ощущениями.

Пока хотя бы часть этих условий не выполнена, разумно считать, что мы видим ускорение отдельных задач, ровно как и написала сама OpenAI 9 сентября 2026 года.
metr.org Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity We conduct a randomized controlled trial to understand how early-2025 AI tools affect the productivity of experienced open-source developers working on their own repositories. Surprisingly, we find that when developers use AI tools, they take 19% longer than…
  • ❤ 3
More from @airamongush
  1. Sep 17, 2026Атмосфера на кампусах сегодня: phd студенты бегают по коридорам и кричат, что гипотеза Ход…
  2. Sep 16, 2026photo post
  3. Sep 16, 2026Тувинская и якутская клавиатуры добавлены в iOS 27 Для новичков в канале — я основательниц…
  4. Sep 14, 20266. AGI и RSI это разные вещи, и приравнивать их значит путать цель со средством. RSI это м…
  5. Sep 14, 2026b) Оценки фронтиер-лабораторий 2025 и 2026 годов огромны. OpenAI 2 октября 2025 года завер…
  6. Sep 14, 2026В октябре 2025 года Сэм Альтман в прямом эфире и затем в посте на X сформулировал внутренн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →