TGViewer
VideoLab & Self-Motivated Learning VideoLab & Self-Motivated Learning @vgcourse · 1.28K subscribers
Post #405 1.49K
Господа!

К вопросу об изменении ландшафта специальности программист. 😉

Как знают внимательные читатели, я давно и с интересом слежу за SWE-bench (тык, тык, тык, тык...). В числе участников там Amazon, Google, IBM, Alibaba, ByteDance, Anthropic и другие вполне серьезные товарищи. Ровно поэтому этот бенчмарк и показателен.

Если стартапы очень часто ради раунда инвестиций затачиваются под датасет, то у больших компаний такое тоже бывает (что уж там, мы когда-то активно поучаствовали во вскрытии мухлежа Microsoft), но, как правило, результат серьезных дядь намного более воспроизводим и при независимых тестах похож.

Какие мысли, глядя на свежий топ номинации Verified (наиболее показательной):

1. Обратите внимание — практически весь топ — новые (последние 3 месяца). Обновление топа идет очень быстро!

2. ByteDance со свежим trae.ai всех порвали, выбив 75%, но важнее, что их агент опенсорсный
https://github.com/bytedance/trae-agent! Думаю, что это многих забустит!

3. На мой вкус крайне интересен прогресс Google. Их последняя Gemini выстрелила очень неплохо! Обратим внимание, что последний раз они сабмиттили модель аж в декабре. Скорее всего публичных сабмитов нет, поскольку они не первые (а показывать, что они в топе им не нужно), но топ явственно полнее, чем мы видим.

В целом можно констатировать, что SWE-bench довольно быстро насыщается!

Программистских агентов ругают, но главный аргумент в их пользу — где вы найдете такого джуна за 20$? 😁

Понятно, что на пути прогресса много чудного, например, вот недавняя история как раз с использованием Gemini 2.5 Pro в Cursor:
При решении весьма стандартной задачи ИИ-агент впал в отчаяние и депрессию, а в конечном итоге и в режим саморазрушения, решив удалить весь код 😱 Все шаги сопровождались очень персональными сообщениями, похожими на поведение человека в отчаянии и депрессии.

Что-то подсказывает, что агент Google скоро научится прямо говорить ("а ты, дорогой, не офигел ли такую сложную задачу давать?"))) и такое поведение починят, но сейчас это прям на редкость прекрасно 😉

———

Недавно меня пригласили выступить на вручении дипломов магистров ВМК.

Я долго думал, что сказать. Ограничиться ли обычными словами о том, какие все молодцы или сказать горькую правду. Выбрал второе. И сказал, что при текущей скорости прогресса с огромной вероятностью через 3 года модели будут уверенно решать задачи, на которые прокачанным программистам нужно 2-3 дня. А через 4 года дойдет до недели. Это значит, что агенты начнут выполнять задачи уровня спринта. И это будет революция, поскольку компании начнут сокращать мидлов и частично синьоров. В этом плане главный экзамен для сегодняшних выпускников будет через 4 года — останутся они в профессии (и начнут получать скорее всего больше) или будут вынуждены сменить профессию? Я попытался смягчить как мог, но зал, очевидно, напрягся. Наверное больше меня не позовут 😂 Незачем людям портить праздник) 😉

Господа, вы живете в феерически интересное время!

#SWE_benchmarking
  • ❤ 16
  • 👍 5
  • 😁 2
  • 👎 1
More from @vgcourse
  1. Sep 26, 2026Post #568
  2. Sep 12, 2026Post #567
  3. Sep 8, 2026Post #566
  4. Sep 8, 2026Всем привет! Уже завтра состоится вводная лекция спецкурса «Методы обработки и сжатия меди…
  5. Sep 2, 2026Post #564
  6. Aug 30, 2026Post #563
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →