Про новую макроэкономику ИИ
Один из крупных разметчиков данных для ИИ-лабораторий Mercor сравнил работу бухгалтеров с ИИ-моделями на реальных задачах и предлагает иначе мерить момент, когда модель обходит человека.
Вообще сейчас пошел тренд на ИИ-бухгалтерию, тут кейсы
Компания наняла 12 бухгалтеров, в среднем с 5,5 годами опыта, и дала им 4 задачи. Те же задания прогнали через модели разных лет.
Люди работали без ИИ и им дали 3 часа на каждую задачу.
Авторы исследования говорят, если в мае 2025 бухгалтеры были сильнее ИИ-моделей, то сейчас модели на этих заданиях почти идеальны, быстрее и на порядок дешевле даже лучшего специалиста из выборки.
Из этого видно противоречие, что баллы на бенчмарках за пару лет взлетели, а в статистике, например, США вклад ИИ в рост производительности пока почти не виден.
Чтобы это разобрать, нужно понимать, как тест соотносится с настоящей работой, и как её сделал бы человек.
Отсюда вытекает второй вывод - пока модель слабее человека, логично спрашивать на бенчмарках, когда она его догонит.
Но когда она упирается в потолок своих возможностей, тогда такой бенчмарк ничего не различает.
Дальше полезнее смотреть на задачи, которые раньше были слишком дорогими или невозможными.
Mercor ставит вопрос: в какой момент на конкретной работе модель проходит человеческий уровень?
Что из этого следует для рынка труда - отдельный вопрос, и он не заменяет подсчёт экономики ИИ.
_______
Источник | #blockchainRF
@F_S_C_P
-------
Поддержи канал подпиской
-------
Post #123734
498