Такси или личный водитель: почему лучшие ИИ не справляются с настоящей работой
Лучшие в мире ИИ-модели справляются меньше чем с половиной задач, которые рядовой айтишник в крупной фирме закрывает за обычный рабочий день. Это не моя оценка, это свежий бенчмарк Artificial Analysis и IBM. Они собрали 59 реальных задач корпоративного ИТ, тех самых, что приходят в тикетах инженерам инфраструктуры и ребятам на дежурстве, и прогнали через передовые модели. Лучшая в замере набрала 47 процентов. Остальные ниже. И это передовые модели на свете, а не средние. Это диагноз, а не сенсация.
Странность в том, что параллельно в новостях те же модели «обгоняют человека на математической олимпиаде», «сдают экзамен на адвоката», «решают задачи школьного уровня лучше, чем выпускник». Можно подумать, мы живём в момент, когда машина уже умнее нас по всем фронтам человеческих знаний. Но почему она на корпоративном бенчмарке спотыкается на простых вещах.
Скептики все еще говорят, что ИИ не дотягивают до человека, что модели глупы. Однако ответ в том, что ИИ не понимает контекст, в который его привели. Та же модель в чате блестяще отвечает на абстрактный вопрос про сети, и она же в живой задаче упирается в то, чего никто ей не объяснил: какая у вас сеть, кто чем владеет, какие правила в этом конкретном месте, что вчера сломалось и почему именно так.
Я долго искал хорошую аналогию для этой разницы. Сначала ходил вокруг противопоставления «таксист и механик». Но это неточно: они вообще делают разные вещи, и сравнение получается так себе, всё равно что говорить «ваш помощник не умеет варить кофе». Хорошая аналогия должна быть в одной плоскости: один и тот же навык, разный охват. Когда я об этом подумал, всплыл другой образ. Таксист и личный водитель…,.,
——
Продолжение лонгрида в клубе МИМ.
Post #684
788