TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 280K subscribers
Post #10921 25.6K
📌ApprenticeBench: проверка способности ИИ освоить работу как новый сотрудник

Стартап NeoCognition разработал первый сквозной бенчмарк использования компьютера, непрерывного обучения и долгосрочной агентной работы на реальной должности.

NeoCognition - лаборатория, в которой собрали бенчмарки MMMU, Mind2Web, SWE-Bench Pro и OSWorld 2, а также агентные системы SeeAct, UGround и HippoRAG.


Агента принимают в виртуальную строительную компанию на работу с кредиторской задолженностью, выдают полугодовой архив счетов, внутренний справочник и руководство по ERP-системе, после чего он начинает работать со счетами.

Первый месяц проходит с подробным фидбэком от руководителя по каждому счёту, а дальше - с редкими замечаниями по итогам месяца.

Каждая из ста задач теста проверена профессиональными бухгалтерами строительной отрасли, которые подтвердили и реалистичность сценариев, и то, что любую задачу способен решить рядовой специалист, изучивший доступные агенту материалы.

🟡Результаты

Большинство моделей, включая Gemini, Muse Spark, Grok и Kimi, не преодолевают порог в 20-25%, тогда как Fable 5.1 выполнила 72% задач, а GPT-6 Astra - 68%.

Лучший из двух тестировщиков-людей показал 51%, причём проваливались люди на поиске нужного в исторических данных, точности расчётов и мелких ошибках от утомления.

Разрыв между открытыми и закрытыми моделями авторы называют крупнейшим из всех виденных ими на бенчмарках - 72% у Fable 5.1 против 18% у Kimi K3, и вызван он не базовыми операциями в интерфейсе, а неспособностью слабых моделей учиться на дистанции.

Kimi K3 почти не обращался ни к архиву счетов, ни к собственным заметкам и деградировал к концу серии.


🟡GUI vs API

Так называемый налог на использование компьютера (просадка при переходе с API на графический интерфейс) у большинства моделей достигает 78%, но Fable 5.1 и GPT-6 Astra работают через GUI даже лучше, чем через API.

Дешевле при этом остаётся API - Fable 5.1 обходится в 6,95 доллара за задачу в программном интерфейсе против 18,23 доллара при работе с графическим.

🟡Обучаемость

Способность к обучению измерили отдельно. Fable 5 без доступа к истории и обратной связи, опираясь только на собственные знания, решает 11 счетов из 100.

Подключение архива счетов поднимает результат до 31, обратная связь руководителя - до 35, а оба канала вместе дают 43.

🟡Вывод

ИИ пока ещё обходится дороже: 18,23 доллара за задачу против 7,21 у людей. К тому же человек по мере накопления опята работает быстрее, а агент - замедляется.

🔜 Посмотреть часовой прогон Fable 5.1 по всем ста задачам.


@ai_machinelearning_big_data

#AI #ML #Benchmark #ApprenticeBench #NeoCognition
  • 🤔 112
  • ❤ 46
  • 👏 30
  • 💯 15
  • 👍 13
  • 🔥 6
  • 👌 4
  • 🎉 2
  • 🤓 2
  • 👀 1
More from @ai_machinelearning_big_data
  1. Sep 24, 2026👆 Трамп высказался против замедления ИИ перед встречей с Си Цзиньпином. Он заявил, что хо…
  2. Sep 24, 2026✔️ OpenAI предложила правила внешнего аудита безопасности своих моделей Компания готова от…
  3. Sep 24, 2026✔️ Сотрудник Anthropic объяснил, почему Claude стал писать тексты хуже Джексон Кернион, ко…
  4. Sep 24, 2026За AI-навыки в вакансиях платят на 62% больше PwC - одна из компаний «большой четвёрки» -…
  5. Sep 24, 2026📌 Что показали на Meta* Connect 2026 На конференции Connect 2026, которая проходит 23–24…
  6. Sep 23, 2026🧬 Claude обнаружил ранее неописанную ферментную систему с повторами ДНК, напоминающими CR…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →