TGViewer
VideoLab & Self-Motivated Learning VideoLab & Self-Motivated Learning @vgcourse · 1.28K subscribers
Post #357 1.18K
Господа!

Тут вчера вышел новый Sonnet, который показал (в том числе) неплохие результаты на моем любимом в этом сезоне SWE-bench Verified. Причем интересно, что если мы зайдем на сам SWE-bench, то увидим что ТОП-10 свежих результатов лежат в диапазоне 54,2%-64,6%, т.е. реальный результат 3.7 сонета — это второе место и только в прыжке (до 70,3%) первое. С другой стороны они представляют все-таки универсальную модель (которые, заметим, вполне себе любят программисты) и в сравнении с другими универсальными моделями результат великолепен и ступенька достижения оч хороша.

Показательно, что в опубликованном 4 дня назад отчете "AI progress is about to speed up" от Epoch.AI те вангуют 90% SWE-bench Verified к концу года. Учитывая, что в сентябре у них было 45% и 70% в прыжке сейчас в 90+% в конце года вполне верится. Т.е. бенчмарк по сути утратит смысл (как и многие другие бенчмарки), о чем я писал тут (кстати за неделю до того, как тезис популяризировал человек из OpenAI).

Модное возражение на тему — это переобучение (модель уже видела такие примеры в обучающей выборке). Классика жанра, которую мы видим в десятках подобный бенчмарков снова и снова — да, у кого-то из топа (кому ну ооочень надо оправдать деньги инвесторов, например))) это будет переобучение. Но тех, у кого это реальный результат, т.е. меняешь постановку задачи и сеточка справляется будет, похоже, немало. Хорошо видно, как они довольно кучно идут.

Также Джефф Динн (Google's Chief Scientist) в интервью пару недель назад сказал, что 25% кода компании уже пишет ИИ. Как они считали деталей нет и скорее всего это автозаполнение, но сколько было процентов год назад? Ноль? Они явно внутри ассистентов интегрируют и раскатывают.

В посте с большой (для этого канала) дискуссией, где я писал, как Альтман планирует к концу года выпустить ТОП-1 программиста по рейтингу CodeForces, был чудный график в заголовке, из которого следует, что количество вакансий программистов с января 2020 (до ковида) до начала 2022 года сильно выросло (быстрее остального рынка труда), а за следующие 3 года упало (также сильнее остального рынка труда).

В этом плане многие (начиная с Дженсона Хуанга) вангуют сильные измерения рынка труда программистов. В первую очередь это массовое распространение ассистентов, следствием чего ключевой задачей станет ПОНИМАНИЕ ТОГО, ЧТО ПРОИСХОДИТ В КОДЕ. Т.е. Code Monkey Programmers (In simpler term, it's someone who doesn't understand the fundamentals of programming and works on mostly unimportant stuff) и гугл-программисты потеряют работу. При этом есть очень приятные версии что в целом спрос на программистов возрастет. Более того — заметно возрастет спрос на топовых программистов, способных собственно к созданию топовых решений.

Ну и вишенкой на торт — Open AI анонсировали новый бенчмарк SWE-Lancer, в который они собрали 1400 реальных задач по программированию (поэтому SWE) с фриланс сервиса Upwork с ценой от 50$ до 32000$ за задачу и общей суммой миллион долларов. Нормальной публикации пока нет, но предварительно первое место выбил Claude 3.5 Sonnet с суммой решенных задач в $403к. (Возможно, поэтому пока нет страницы бенчмарка))) С другой стороны что-то они низко планку поставили, похоже, такими темпами бенчмарку пару лет не продержаться.

А Google, кстати, выкатили AI co-scientist. Это значит, что конкуренция с китайцами и американцами в следующем году станет совсем жесткой.

В общем безмерно интересные вещи происходят прямо на наших глазах! И задача удержаться на гребне волны! Погнали! 😁😁😁
  • ❤ 6
  • 👏 3
  • 🎉 1
More from @vgcourse
  1. Sep 26, 2026Post #568
  2. Sep 12, 2026Post #567
  3. Sep 8, 2026Post #566
  4. Sep 8, 2026Всем привет! Уже завтра состоится вводная лекция спецкурса «Методы обработки и сжатия меди…
  5. Sep 2, 2026Post #564
  6. Aug 30, 2026Post #563
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →