Нейросети с треском провалили экзамены по реальным профессиям 😄
Ученые из Калифорнийского университета в Беркли собрали полторы тысячи реальных рабочих задач из 55 разных профессий. Выяснилось, что передовые алгоритмы, которые по словам топ-менеджеров должны завтра оставить нас без работы, на самом деле вообще не тянут сложный интеллектуальный труд.
Абсолютный лидер тестирования в лице GPT-5.5 кое-как осилил 24 процента заданий. А когда дело дошло до самого высокого уровня сложности, требующего узких знаний и длительных логических рассуждений, все без исключения модели показали ровно ноль процентов успеха. Отдельно исследователи пнули хваленую нейросеть Fable 5. Оказалось, что она выдает такие же посредственные результаты, как и конкуренты, но при этом сжигает от четырех до двенадцати раз больше денег на каждую задачу.
Идеальный корпоративный сотрудник: ничего не понимает в сложных процессах, но требует гигантскую зарплату 👍
В сухом остатке выяснилось, что современные ИИ-агенты годятся только на роль продвинутых макросов для автоматизации самой примитивной и монотонной рутины.
🥸 Новости IT: 📱 Telegram | 📱 ВК | 📲 MAX
Post #11821
925

- 🔥 10
- 😁 2