Ночная смена в стационаре. Врач с 14 годами практики принимает тяжёлого пациента: нужно быстро сформировать план — анализ, терапия, наблюдение. Рядом запускают ИИ: по тем же данным он собирает рабочий план за секунды. Дальше — проверка врача и решение.
Идея проста: сравнили не игрушечные тесты, а реальную работу человека и машины. OpenAI собрал большой замер по 44 профессиям и 1320 задачам из 9 отраслей, задачи готовили спецы со средним стажем 14 лет.
В итогах: Claude Opus 4.1 показал самый высокий суммарный результат (wins+ties) — 47,6% и силён в оформлении материалов; GPT-5 лидирует в точности, а прогресс за 15 месяцев от GPT-4o к GPT-5 — почти ×3 (≈13,7% → ~40%).
Какие именно 44: консьержи; управляющие недвижимостью и ТСЖ/HOA; агенты по продаже недвижимости; брокеры по недвижимости; клерки по прокату; специалисты по организации досуга; специалисты по комплаенсу; начальники первой линии полиции и следствия; руководители админслужб; соцработники (дети/семьи/школы); инженеры-механики; инженеры по производству; закупщики; клерки по отгрузке-приёмке и инвентаризации; мастера/начальники смен на производстве; разработчики ПО; юристы; бухгалтеры и аудиторы; руководители ИТ; специалисты по управлению проектами; медсёстры (RN); практикующие медсёстры (NP); руководители медслужб; руководители первой линии офисного/админперсонала; медсекретари и админ-ассистенты; специалисты поддержки клиентов; фин- и инвестаналитики; финменеджеры; персональные финсоветники; агенты по продаже ЦБ, товаров и финуслуг; фармацевты; руководители смены в рознице; генеральные/операционные менеджеры; частные детективы; руководители продаж; клерки по заказам; руководители оптовых продаж (первая линия); торговые представители опт/производство (кроме тех/научных продуктов); торговые представители опт/производство (тех/научные продукты); аудио- и видеотехники; продюсеры и режиссёры; обозреватели/репортёры/журналисты; видеомонтажёры; редакторы.
И что?
Для бизнеса:
на «золотом» наборе из 220 задач модели уже выигрывают/на паре в 39–49% кейсов по 44 профессиям — часть работы можно переложить на ИИ без проседания качества; решают быстрее и масштабируются под нагрузку.
Для инвесторов: динамика за 15 месяцев — почти ×3 по метрике wins+ties у GPT-5 против GPT-4o — это ускорение unit-экономики знаний: меньше человеко-часов на выпуск типовых отчётов/планов, выше валовая маржа у внедривших ИИ.
Для людей: ИИ уже уверенно берёт часть врачебных планов, юридических меморандумов, фин-разборов, презентаций; роль человека — постановка задачи, контроль и ответственность за решение.
🚨 Нам 3.14здец
Специалисты со стажем 10+ лет — 8/10 — паритет по качеству на половине задач в ряде ролей; что делать: уходить в задачи принятия решений, кросс-функциональное лидерство, контроль рисков.
Университеты и профкурсы — 6/10 — цикл апгрейда моделей месяцами, учебных программ — годами; что делать: перестраивать на «человек+ИИ» и тренировать надзадачи.
Post #1911
1.15K

- 👍 10
- ❤ 3