TGViewer
Книжный куб Книжный куб @book_cube · 15.7K subscribers
Post #5019 697
Annotated_Measurements_for_understanding_the_pace_of_AI_development.pdf2.4 MB
Anthropic: кто будет делать следующий ИИ (Рубрика #AI)

Если ИИ помогает создавать следующую, более сильную модель, он может ускорять и собственное развитие. Для нас это означает возможное сокращение времени между появлением новых инструментов и очередной перестройкой работы под них. В перспективе человеку придётся управлять исследовательскими агентами, которые выполняют всё больше работы самостоятельно. И понимать, когда пора вмешаться.

В материале Anthropic есть график, глядя на который я задумался и записал вопрос про сходимость тренда к 2027 году. По данным компании, в марте 2026-го Claude вёл 1% исследовательских и инженерных работ, а в августе — уже 26%. ИИ как минимум сотрудничал с человеком более чем в 90% работ. Проценты относятся к взвешенной корзине категорий задач внутри Anthropic. Слово «вёл» здесь означает определённый уровень самостоятельности.

17 июня 2026 года Jean-Stanislas Denain, Joe Kwon и Anson Ho предложили шкалу от 0 до 5 в публикации Epoch AI. В начале шкалы ИИ либо не используется, либо помогает с отдельными частями работы. Дальше меняется распределение инициативы:
- AL3: агент делает большие куски, человек постоянно направляет и собирает результат.
- AL4: агент получает общую задачу и выполняет большую часть работы; человек наблюдает, корректирует и утверждает.
- AL5: задача выполняется целиком при минимальном участии человека или без него.

Например, на AL4 можно поручить агенту починить сломавшийся конвейер данных: он найдёт причину, внесёт изменения, проверит их и принесёт отчёт. Решение о внедрении останется за инженером. В августовском срезе Anthropic нет измеренных категорий R&D уровня AL5.

Теперь понятно, откуда взялся 2027 год. Между мартом и августом доля AL4 росла примерно на пять процентных пунктов в месяц. Если продолжить этот темп, к лету 2027-го получится около 76% работ как минимум уровня AL4, а к концу года линейный расчёт упрётся в 100%. Это моя условная экстраполяция. Она предполагает, что темп сохранится и оставшиеся задачи окажутся сопоставимы с уже переданными агентам. Но среди них могут быть выбор исследовательского направления, оценка неожиданного результата и решение, куда потратить огромный вычислительный бюджет. Агент, который реализует эксперимент, ещё может зависеть от человека, который придумал, что проверять.

А дальше в статье появляются примерно 30 тысяч одновременно работающих агентов — на одной внутренней платформе Anthropic. Тут человеческое «я всё посмотрю» требует довольно серьёзного уточнения :)

Компания измеряет охват мониторингом, задержку проверки и долю блокировок или эскалаций. У неё заявлен 100% охват действий на этой платформе. Охват показывает, что проверка встроена в процесс; чтобы судить о её качестве, нужно знать, сколько опасных действий она пропускает.

Мне понравилась деталь с постоянной идентичностью агентов: история сохраняется при смене модели, сообщения связаны с авторами и исходными данными. Можно восстановить, кто предложил решение и откуда оно взялось. При этом общий канал связи способен распространять и общую ошибку — возможность проверить источник ещё надо использовать.

С вычислениями похожая история. Расход удобно учитывать, но доля ресурсов «на безопасность» зависит от классификации работ и их эффективности. Она может снизиться из-за экономии вычислений при том же объёме работы над безопасностью. Сведения об автоматизации собирает Claude, оценивает их тоже Claude. Для доверия к таким числам важны общая методология и внешняя проверка.

Похоже, нас ждёт всё больше процессов, где человек выбирает направление, агенты выполняют работу, а другие агенты помогают её проверять. Если этот цикл начнёт устойчиво улучшать следующие модели, ускорение может стать гораздо заметнее. Тогда способность вовремя обнаружить ошибку, восстановить ход решений и остановить процесс станет такой же важной, как способность его запустить.

P.S.
Я часто веб-версии таких статей превращаю в PDF, чтобы спокойно почитать их на планшете и параллельно писать заметки прямо поверх них - так мне лучше думается

#AI #Agents #Research #Engineering #Metrics #Security
  • ❤ 5
  • 👍 4
  • 🔥 2
More from @book_cube
  1. Oct 1, 20263 AImigo S1E8: AI-native: что это значит для компании? (Рубрика #Management) Раздать сотру…
  2. Oct 1, 2026AMD договорилась купить World Labs за $8,2 млрд (Рубрика #AI) Я уже разбирал доклад Фей-Фе…
  3. Oct 1, 2026Заходите на прямой эфир с Никитой Белокопытовым, где мы с ним поговорим про его карьеру и…
  4. Oct 1, 2026Материалы выпуска: как руководить тем, в чём пока не разбираешься — Леонид Черный (Рубрика…
  5. Sep 30, 2026Как обычно превосходный юмор и очень точное попадание во всех топ-менеджеров AI компаний.…
  6. Sep 30, 2026Как инженер учится договариваться (Рубрика #Leadership) 2 октября в 10:30 по МСК в прямом…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →