TGViewer
Книжный куб Книжный куб @book_cube · 15.8K subscribers
Post #4708 2.95K
[1/2] Claude Code и экспертиза: что показали 398 тысяч сессий (Рубрика #AI4SDLC)

Добавлял в корпус мета-исследования AI4SDLC 2026 свежую работу (16 июня 2026) Anthropic "Agentic coding and persistent returns to expertise", в заголовок которой вынесен вывод о том, что кодинговые агенты не отменяют экспертизу. Но для меня здесь интереснее другое - подход авторов к измерению разделению труда между человеком и Claude Code на реальных рабочих сессиях. Это большой, но не экспериментальный источник. Anthropic взяла случайную выборку из 398 198 интерактивных сессий 234 751 пользователя с октября 2025 по апрель 2026 года. В выборку вошли Claude Code в CLI, Claude.ai и desktop-приложение. Внутренние сессии сотрудников Anthropic, сторонние IDE, SDK и headless-запуски исключили. Это сильные наблюдательные данные одного продукта, а не независимое исследование всей разработки ПО.

Метод устроен интересно. Модельные классификаторы читали транскрипты с сохранением приватности и размечали:
- какой вид работы выполнялся;
- кто принимал решения о планировании и исполнении;
- какую предметную компетентность показывал пользователь;
- чем закончилась сессия.

Часть классификации авторы сверяли с независимой телеметрией: числом обращений к модели и инструментам, объёмом вывода, добавленными и удалёнными строками. А commits, tests и подтверждение пользователя искал уже отдельный transcript-классификатор успеха. Исследователи не читали отдельные приватные транскрипты, а публиковали только агрегаты.

Под экспертизой авторы понимали компетентность пользователей в текущей задачи (а не грейд, стаж или название должности). Для оценки экспертизы авторы использовали классификатор оценки компетентности в рамках задачи по пяти уровням: насколько точно он задаёт рамку, понимает терминологию, просит проверить конкретные риски и исправляет Claude по существу. Senior-разработчик, впервые пишущий на Rust, может оказаться начинающим в задаче на Rust кодинг. Бухгалтер без опыта Python, который точно задаёт правила сверки и ловит ошибку в обработке закрытия месяца, - это эксперт в бухгалтерской задачи. Итого: исследование не сравнивает junior и senior engineers.

Результаты получились интересными

1️⃣ Разделение труда уже заметно
В типичной сессии человек принимал около 70% решений о том, что делать, но только 20% решений о том, как именно это выполнить. Иными словами, пользователь в основном удерживал цель и критерии, а Claude - выбор файлов, команд и деталей реализации. Это хорошо ложится на цепочку, о которой я писал в State of AI4SDLC:
intent → context → plan → tasks → implementation → verification.
Анализ Anthropic не доказывает, что весь SDLC уже перестроился, но показывает похожий паттерн внутри интерактивной работы с агентом.

2️⃣ Различные по уровню компетенции сессии приводили к разному уровню
делегирования
В сессиях, размеченных как novice, один запрос запускал примерно 5 действий Claude и 600 слов вывода, а в expert-сессиях - около 12 действий и 3 200 слов. Связь сохранялась после учёта work mode, task value, месяца, профессии и model family. Но «больше действий и текста» ещё не значит «больше полезной работы». Длинная цепочка может быть автономным исполнением, а может - лишними итерациями и переделками. Пока это мера делегирования, не productivity.

3️⃣ Более высокая оценка expertise была связана с более частым `verified success`

После статистической корректировки этот показатель рос с 14,5% у novice до 20,9% у beginner, 28,3% у intermediate, 29,5% у advanced и 32,9% у expert. Основной скачок происходит между novice и intermediate; между intermediate и expert прирост заметно меньше. Verified success здесь означает, что классификатор счёл цель достигнутой и нашёл хотя бы один сигнал: прошедший тест или команду, подходящий commit/PR либо явное подтверждение пользователя. Это строже простого модельного вердикта, но ещё не означает, что изменение дошло до production и принесло пользу.

Я уже разбирал Anthropic Agentic Coding Trends и переход от написания кода к управлению агентами. Новая работа добавляет к этой линии наблюдаемый паттерн: агент забирает большую часть исполнения, а task-specific expertise связана с более частым успехом сессии.

А в следующей части разберу неприятный вопрос: насколько надёжно здесь измерены expertise и success, почему корреляция ещё не причинность и что отдельный рандомизированный эксперимент говорит о формировании навыков.

#AI #AI4SDLC #Research #Engineering #Agents #Metrics #DevEx
Anthropic Agentic coding and persistent returns to expertise New Anthropic research looking at interactive agentic coding. We evaluate the composition of tasks, human-AI collaboration, and success rates.
  • ❤ 13
  • 🔥 3
  • 👍 2
  • 🤣 1
More from @book_cube
  1. Sep 24, 2026Завтра у меня интересный день, где будет сразу 3 активности, на которых вы можете поймать…
  2. Sep 24, 2026Разбор whitepaper о vLLM: KV-кеш, PagedAttention и быстрый инференс | Research Insights #3…
  3. Sep 24, 2026Команда с ИИ: что меняется в работе руководителя | Code of Leadership S2E22 с Димой Твердо…
  4. Sep 24, 2026SWE-bench: как выбирать агента, когда рейтинг не различает лидеров (Рубрика #AI4SDLC) У од…
  5. Sep 23, 2026Как руководить тем, в чём пока не разбираешься | Леонид Черный | Code of Leadership S2E23…
  6. Sep 23, 2026Прямой эфир с Фёдором Сухаревым стартует, подключайтесь и задавайте вопросы.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →