TGViewer
Channel Public Channel
Книжный куб

Книжный куб

@book_cube

Канал Александра Поломодова (@apolomodov), cto & technical fellow.

https://polomodov.tech - сайт со всеми материалами
youtube.com/@tellmeabouttech - канал со всеми видео
Subscribers
15.7K
Photos
3K
Videos
6
Links
2.5K

Showing posts older than #4696 · Back to latest

Older Posts 5 shown
Post #4695 2.98K
Cursor Developer Habits Report: AI-ускорение явно проявляется у продвинутых пользователей (Рубрика #AI4SDLC)

Разбирался с "Cursor Developer Habits Report" за весну 2026, в котором много интересных графиков про ускорение разработки, рост контекста и автоматизацию. Но один из самых интересных инсайтов в том, что продуктивность среди пользователей растет не ровным слоем, а резко усиливает тех, кто уже умеет вплетать агентную работу в свой день. Если говорить про само исследование, то оно построено на агрегированных продуктовых/инженерных данных: использовании агентов, токенах, принятых AI-изменениях и активности смердженных PR. Данные пользователей приватного режима, которые выбрали opt-out, туда не входят.

Основные находки, что вынесены в начало отчета такие

1️⃣ Ускорение разработки
Скорость написания кода удвоилась год к году, pull request’ы становятся крупнее и глубже, а код, сгенерированный агентами, всё чаще успешно проходит ревью.
2️⃣ Экономика интеллекта
Авторы сравнили семь семейств моделей по стоимости строки кода и стоимости одной отправки задачи, выявляя значительные различия в юнит-экономике. Если зафиксировать успешность решения задач, то самыми дорогими моделями являются Opus, потом ChatGPT, а потом Composer 2.5 от Cursor, причем разница между Cursor моделью и Opus на порядки
3️⃣ Разрыв между продвинутыми пользователями и остальными
Авторы обнаружили, что, хотя AI приводит к широкому росту продуктивности, наиболее выраженные изменения наблюдаются у топ 1% разработчиков.
4️⃣ Рост роли контекста
Авторы показали резкое увеличение количества входных токенов и сдвиг в сторону токенов, считываемых из кэша. Это даёт агентам своего рода рабочую память, позволяя им решать более сложные задачи и писать более качественный код.
5️⃣Сдвиг к автоматизации
В
конце авторы показали данные об эволюции кодинг агентов: из инструмента для отдельных разработчиков они превращаются в целую систему для создания и сопровождения софта, часто работающую автоматически.

Интересно погрузиться поглубже в блок "The power user gap", где авторы приводят кривую Лоренца по AI строчкам кода, AI потреблению токенов с индексами Джини 0.77, 0.75 и 0.72. Обычно кривую Лоренца и коэффициент Джинни показывают в контексте экономического неравенства. И тут примерно такое же неравенство - небольшая группа пользователей генерирует непропорционально большую часть AI-работы, расходов и токенов. Из кривой Лоренца видно, что верхние 5% дают примерно 47% AI строк кода, 46% трат и 40% токенов.

Дальше еще интереснее:
- p99-разработчики производят в 46 раз больше AI lines per day, чем медианный активный пользователь, и в 15 раз больше merged PRs per week, чем медианный активный автор PR
- p90-разработчик выглядит скромнее: 10x по AI строк кода и 4x по merged PRs

В итоге, мы видим, что не "каждый разработчик стал на 15% быстрее" - у нас распределение с очень тяжелым хвостом, к которому просто так среднее не применишь (полезнее хотя бы на медиану смотреть)

Правда, тут не стоит обязательно восхищаться этими продвинутыми пользователями - мы не можем сказать, что "лучшие разработчики стали в 46 раз быстрее", так как в метрике смешаны тип задач, размер кодовой базы, роль в команде, доверие к инструменту, качество контекста, разрешений, привычка дробить работу, возможность запускать агента в фоне и культура ревью. Но график интересен управленчески - он показывает как выглядит как может выгляядеть новая операционная модель работы.

Если в команде появляется человек, который уверенно ставит агентам задачи, дает им контекст, читает diff, запускает тесты, режет scope и быстро снимает блокировки, он может уехать далеко вперед. Не потому, что нажал секретную кнопку, а потому что вокруг него собрался рабочий цикл: intent -> context -> agent run -> verification -> commit/PR -> feedback. У другого разработчика тот же Cursor может оставаться дорогим автодополнением, который иногда мешает.

Отсюда практический вывод для AI4SDLC: считать средний usage мало. Нужны метрики по когортам, чтобы понимать
- Кто реально доводит AI-работу до PR?
- Где появляются крупные diff'ы?
- Что происходит с нагрузкой на ревью, тесты, как дела с rework и насколько вырос change failure rate?
- Чем отличаются топовые пользователи: они лучше формулируют задачи, лучше знают кодовую базу, чаще используют agents/automations, работают в более permissive repo или просто берут задачи другого класса?

Если у вас есть такие power users, то надо пообщаться с ними, понять какие практики они используют и дальше масштабировать лучшие из них.
Но нельзя просто посмотреть на хвост распределения и сказать, что режим power-user теперь является нормой для всех - так оно не полетит:)

P.S.
Разбор исследования Cursor есть на нашем сайте ai4sdlc-research.space.

#AI #AI4SDLC #Engineering #Agents #DevTools #Management #Metrics
Cursor Cursor · Insights Data and reports from Cursor on how AI is changing software development.
  • ❤ 10
  • 👍 5
  • 🔥 1
Post #4685 2.46K
Иллюстрации из бенча "SWE-Interact"
  • ❤ 5
  • 🔥 2
  • 👍 1
Post #4684 2.16K
SWE-Interact: сколько стоит интерактивность кодинг-агентам (Рубрика #AI4SDLC)

Решил сегодня рассказать про вторую статья про оценку кодинг-агентов в диалоге - "SWE-Interact: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions" от Scale AI. Любопытное совпадение: она вышла на arXiv 29 июня 2026 — в тот же день, что и SWE-Together от Meta (запрещенной в России), который я сегодня разбирал. Две команды практически одновременно пришли к одной мысли: одноходовые бенчмарки перестали отражать реальную работу с агентами, мерить надо диалог. Похоже, multi-turn оценка оформляется в отдельное направление (или Meta и Scale AI как-то связаны ... ах точно Meta же выкупила 49% Scale AI за $14 млрд и еще забрала к себе основателя компании)

Scale собирает бенчмарк с противоположной стороны. Meta идет снизу вверх: из 11,260 реальных сессий восстанавливает 109 задач и якорит симулятор на намерения живых пользователей. Scale идет сверху вниз: берет 75 готовых задач из трех существующих бенчмарков (SWE-bench Pro, SWE Atlas (Refactoring), DeepSWE - первые два, замечу, ее собственные), прячет полную постановку внутрь симулятора пользователя и заставляет раскрывать требования постепенно. Решение при этом проверяет оригинальный верификатор задачи. Ход изящный: та же задача, тот же верификатор - меняется только способ подачи требований. Разница в resolve rate становится почти чистой ценой интерактивности.

И тут цена оказалась реально высокой - лучшие модели решают около 50% задач в одноходовом режиме - и лишь примерно четверть тех же задач в диалоге: GPT-5.5 падает с 48.0% до 24.7%, Opus 4.8 - с 50.7% до 26.7%. При этом шагов обычно в 3–4 раза больше, токенов - до 4.5 раза, а стоимость задачи в 2–3.5 раза выше (у Opus 4.8 - $11.80 против $5.09). Работа с пользователем добавляет отдельную ось сложности задачи.

Симулятор пользователя здесь интереснее, чем у Meta
1️⃣ Авторы создали персону из статистики
Для этого они проанализировали реальные сессии из датасета SWE-chat и смоделировали самый частый типаж - дотошный эксперт в режиме vibecoding: senior-разработчик, который пишет коротко и небрежно, кода сам не трогает (по данным SWE-chat, в этом режиме агент пишет более 99% кода), но придирчиво следит за точными сигнатурами API и выдает замечания по одному за раз
2️⃣ Сам симулятор агентный
у него есть shell-доступ к рабочей копии агента (git, grep, sed, find), и перед тем как ответить, он сам смотрит диффы и коммиты. У Meta симулятор видит только текст - сводки траектории и выводы инструментов; авторы SWE-Together сами перечисляли это среди ограничений. А тут эксперимент показывает, что дотошная персона - это боль: с ней шаги траекторий у большинства моделей растут на 30–50%, число реплик пользователя почти удваивается, а resolve rate снижается у 4 из 5 моделей по сравнению с нейтральным симулятором, который просто выдает требования по запросу.

В статье приведен и разбор провалов (это аудит 287 неудачных траекторий).
- Некоторые модели умеют хорошо распрашивать и уже по расплывчатому описанию закладывают в план более 80% скрытых целей, а GPT-5.5, Opus 4.8 и Sonnet 4.6 к концу диалога закрывают в среднем более 90%
- Провалы сгруппированы так:
-- Технические ошибки реализации (~34% меток)
-- Забытые требования (~34%) - когда требование из ранней реплики так и не попало в финальный код
-- В ~12% симулятор сам не выдал нужное требование, но это скорее всего false positive самого бенчмарка, о чем авторы и говорят в статье.

Есть у исследования и ограничения
- Задач собрано всего 75 (у Meta 109 задач)
- Персона подобрана всего одна (а интересно было бы промоделировать разных пользователей)
- Одноходовый baseline прогнан один раз
- Результат заметно зависит от модели симулятора: с GPT-5.5 в роли пользователя Opus 4.8 решает 30.7%, с Opus 4.7 - 22.7%
- Агенты работали каждый в своей родной обвязке (harness) - Claude Code, Codex CLI, Kimi CLI, а Gemini в сторонней OpenCode, - так что сравнение моделей смешано со сравнением обвязок, в отличие от SWE-Together с единой обвязкой opencode.
- Scale AI - вендор данных и оценки моделей, продвигающий в том числе собственные бенчмарки (два бенча из четырех, из которых набирались задачи, были от Scale AI)

Если подбивать итоги сразу по двум статьям, то у нас есть сигналы с двух ракурсов
- Meta мерила, сколько корректировок пользователя нужно агенту до результата (сильным - меньше)
- Scale мерила, сколько способности теряется, когда требования приходят по частям (даже у сильных - половина)

Практически это означает:
1️⃣ Выбирая модель под реальную работу с людьми, смотрите на multi-turn разрыв, а не только на автономный resolve rate
2️⃣ Из двух главных режимов провала технические ошибки - вопрос к модели, а вот забытые требования лечатся процессом - файл с планом, явный список требований, коммит и ревью на каждую итерацию. Это уже вопрос не бенчмарка, а вашей обвязки.

#AI #AI4SDLC #Engineering #Agents #Evals #Research
arXiv.org SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven... We introduce SWE-Interact, a new testbed for evaluating coding agents on multi-turn, interactive, user-driven software engineering tasks. Existing frontier SWE benchmarks typically provide...
  • ❤ 3
  • 🔥 3
Post #4679 2.32K
Орфей: древний миф, который хорошо работает как рок-опера (Рубрика #Culture)

В мае мы были с женой на рок-опере "Орфей", и это оказался тот случай, когда сначала случайно цепляешься за пару песен, а потом идешь на концерт. Вообще, у меня к древнегреческим мифам давняя привязанность. В детстве я читал их очень много, особенно истории про Геракла: подвиги, чудовища, боги, полубоги, странные семейные конфликты Олимпа и постоянное ощущение, что герой почти никогда не получает простую награду за правильное поведение.

Сейчас забавно вспоминать, что happy end там был скорее исключением, чем правилом. Кто-то побеждал, но платил страшную цену. Кто-то ошибался на один шаг и терял все. Кто-то попадал в чужую божественную интригу, где человеческое желание вообще мало что решало. В детстве меня это почему-то не смущало. Видимо, мифы читались не как сказки про справедливый финал, а как истории про выбор, судьбу и последствия.

Поэтому с "Орфеем" у меня совпало довольно точно. Сначала я наткнулся не на афишу, а на записи: "Шаг в темноту!", "Сон" и "Будь что будет", которые мне сразу зашли. Я оценил напряжение: темноту, сомнение, упрямство, попытку договориться с тем, с чем вообще-то не договариваются. Уже потом я запланировал очное посещение, и тут мы не прогадали. На сцене эта история собирается гораздо плотнее, чем в отдельных треках. Официально "Орфей` описан как мифологический триллер о выборе, судьбе и любви, где история Орфея и Эвридики переплетена с мифом о похищении Персефоны. И вживую это действительно работает именно как переплетение, а не как школьный пересказ "герой спустился в подземный мир".

Больше всего мне понравилось, что постановка не пытается сделать миф удобным. В ней остается то самое античное чувство: даже когда человек действует из любви, он все равно идет через систему сил, договоров, запретов и чужих решений. Орфей здесь не просто романтический певец, который красиво страдает. Он человек, который делает шаг в темноту и не до конца понимает, какую цену придется заплатить за саму попытку вернуть потерянное. А еще это было просто атмосферно и круто. Музыка, голоса, свет, зал, живое присутствие актеров - все вместе дало тот эффект, ради которого стоит иногда выходить из режима "послушаю запись дома" и идти в театр. В записи можно поймать песню. В зале ловишь масштаб.

Показательный момент: прямо в антракте я купил билеты на рок-оперу "Гермес" от той же творческой бригады. Сходить пока не получилось: на даты наложилась командировка во Владивосток. Но сам факт хорошо описывает впечатление от "Орфея": если в перерыве ты уже покупаешь билет на следующую историю, значит постановка свою работу сделала.

В общем, очень рекомендую эту рок-оперу к посещению.

P.S.
Приложенные фото взял из официальной галереи на сайте https://orfey-rock.ru/#gallery

#Culture #Theatre #Music #Rock #Mythology
  • ❤ 6
  • 👍 4
  • 🔥 3
Post #4671 2.32K
Иллюстрации из бенча "SWE-Together"
  • 👍 4
  • ⚡ 1
  • 🔥 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →