Тут вчера вышел новый Sonnet, который показал (в том числе) неплохие результаты на моем любимом в этом сезоне SWE-bench Verified. Причем интересно, что если мы зайдем на сам SWE-bench, то увидим что ТОП-10 свежих результатов лежат в диапазоне 54,2%-64,6%, т.е. реальный результат 3.7 сонета — это второе место и только в прыжке (до 70,3%) первое. С другой стороны они представляют все-таки универсальную модель (которые, заметим, вполне себе любят программисты) и в сравнении с другими универсальными моделями результат великолепен и ступенька достижения оч хороша.
Показательно, что в опубликованном 4 дня назад отчете "AI progress is about to speed up" от Epoch.AI те вангуют 90% SWE-bench Verified к концу года. Учитывая, что в сентябре у них было 45% и 70% в прыжке сейчас в 90+% в конце года вполне верится. Т.е. бенчмарк по сути утратит смысл (как и многие другие бенчмарки), о чем я писал тут (кстати за неделю до того, как тезис популяризировал человек из OpenAI).
Модное возражение на тему — это переобучение (модель уже видела такие примеры в обучающей выборке). Классика жанра, которую мы видим в десятках подобный бенчмарков снова и снова — да, у кого-то из топа (кому ну ооочень надо оправдать деньги инвесторов, например))) это будет переобучение. Но тех, у кого это реальный результат, т.е. меняешь постановку задачи и сеточка справляется будет, похоже, немало. Хорошо видно, как они довольно кучно идут.
Также Джефф Динн (Google's Chief Scientist) в интервью пару недель назад сказал, что 25% кода компании уже пишет ИИ. Как они считали деталей нет и скорее всего это автозаполнение, но сколько было процентов год назад? Ноль? Они явно внутри ассистентов интегрируют и раскатывают.
В посте с большой (для этого канала) дискуссией, где я писал, как Альтман планирует к концу года выпустить ТОП-1 программиста по рейтингу CodeForces, был чудный график в заголовке, из которого следует, что количество вакансий программистов с января 2020 (до ковида) до начала 2022 года сильно выросло (быстрее остального рынка труда), а за следующие 3 года упало (также сильнее остального рынка труда).
В этом плане многие (начиная с Дженсона Хуанга) вангуют сильные измерения рынка труда программистов. В первую очередь это массовое распространение ассистентов, следствием чего ключевой задачей станет ПОНИМАНИЕ ТОГО, ЧТО ПРОИСХОДИТ В КОДЕ. Т.е. Code Monkey Programmers (In simpler term, it's someone who doesn't understand the fundamentals of programming and works on mostly unimportant stuff) и гугл-программисты потеряют работу. При этом есть
Ну и вишенкой на торт — Open AI анонсировали новый бенчмарк SWE-Lancer, в который они собрали 1400 реальных задач по программированию (поэтому SWE) с фриланс сервиса Upwork с ценой от 50$ до 32000$ за задачу и общей суммой миллион долларов. Нормальной публикации пока нет, но предварительно первое место выбил Claude 3.5 Sonnet с суммой решенных задач в $403к. (Возможно, поэтому пока нет страницы бенчмарка))) С другой стороны что-то они низко планку поставили, похоже, такими темпами бенчмарку пару лет не продержаться.
А Google, кстати, выкатили AI co-scientist. Это значит, что конкуренция с китайцами и американцами в следующем году станет совсем жесткой.
В общем безмерно интересные вещи происходят прямо на наших глазах! И задача удержаться на гребне волны! Погнали! 😁😁😁
