В июле 2025 года METR провела рандомизированный контролируемый эксперимент: 16 опытных разработчиков, 246 задач, данные февраля по июнь 2025 года, инструменты Cursor Pro с Claude 3.5 и 3.7 Sonnet. Результат дословно: разрешение использовать ИИ увеличило время выполнения на 19 процентов, с доверительным интервалом примерно от плюс 2 до плюс 39 процентов, при том что после эксперимента те же разработчики оценивали ускорение в 20 процентов. Один эксперимент не приговор, и сама METR отмечает, что это замер начала 2025 года. Но он показывает, как легко спутать ощущение ускорения с ускорением, и почему ощущения плохой измеритель.
4. Что говорят данные о темпе, и как их читать? METR измеряет временной горизонт задач: длину задачи по человеческому времени, которую модель решает с вероятностью 50 процентов. Этот горизонт удваивался примерно каждые семь месяцев в 2019 по 2025 годы, а на данных 2024 по 2025 удвоение выглядит ближе к четырём месяцам. Anthropic на странице When AI builds itself приводит именно эту ускоренную оценку и добавляет внутренние данные: более 80 процентов кода, вливаемого в кодовую базу Anthropic на май 2026 года, написано Claude, Anthropic а типичный инженер во втором квартале 2026 года вливал в 8 раз больше кода в день, чем в 2024 году Anthropic.
Строки кода это количество, а не качество, и Anthropic честно оговаривает, что величина 8x почти наверняка завышает реальный прирост продуктивности. Кривая METR очень чувствительна к нескольким длинным задачам, а человеческие базовые времена измерены лишь для малой части самых длинных задач. Но это не доказательство того, что машина сама выбирает направления исследований. Именно выбор целей Anthropic называет своим главным оставшимся разрывом.
И ещё один датапоинт против прямолинейной экстраполяции. Дэниел Кокотайло, ведущий автор сценария AGI 2027 (апрель 2025), к концу 2025 и в 2026 году сдвинул свою медиану ближе к 2029 и 2030 годам, потому что прогресс идет несколько медленнее сценария. Скептики вроде Эге Эрдиля и Тамая Бесироглу из Epoch AI держат горизонт AGI за 2045 годом и не считают интеллектуальный взрыв правдоподобным, хотя допускают взрывной экономический рост.
5. Что реально засчитывалось бы как доказательство? Нужен повторяемый рост исследовательской способности на протяжении нескольких поколений моделей, измеренный с учётом двух вещей: человеческого вклада и стоимости вычислений. Конкретно я бы смотрела на следующее:
- Растёт ли способность модели самостоятельно выбирать направления исследований, а не только исполнять поставленные эксперименты, ведь именно этот разрыв называет своим Anthropic.
- Сохраняется ли ускорение, когда вы фиксируете бюджет вычислений, а не наращиваете его.
- Держится ли эффект на нескольких поколениях подряд, а не на одном удачном релизе.
- Подтверждается ли он контролируемыми замерами вроде METR, а не опросами и ощущениями.
Пока хотя бы часть этих условий не выполнена, разумно считать, что мы видим ускорение отдельных задач, ровно как и написала сама OpenAI 9 сентября 2026 года.
Post #195
216