Специализированный медицинский ИИ проиграл универсальным чат-ботам. Но не торопитесь с выводамиПривет! Меня зовут Ольга Титова, я
AI Product Manager, выступаю за безопасный и этичный подход к ИИ, и каждую неделю делюсь с подписчиками Femtech Force новостями из мира ИИ и здоровья.
Сегодня — исследование в
Nature Medicine, которое в индустрии встретили громко, но, как мне кажется, местами восприняли слишком однозначно.
💥
Что проверяли?Команда NYU Langone сравнила клинические ИИ-инструменты
OpenEvidence и UpToDate Expert AI с тремя фронтир-моделями: GPT-5.2, Gemini 3.1 Pro и Claude Opus 4.6.
Это не нишевые продукты: по собственным заявлениям компании, OpenEvidence — самое быстрорастущее приложение для врачей в истории, а независимо подтверждённая
оценка $12 млрд и использование в практике больше,
чем половиной врачей США впечатляют не меньше.
Оценка шла в три этапа: общие медзнания (MedQA), согласованность с врачами (HealthBench) и главное — 100 реальных запросов врачей из живой практики (RCQ), вслепую оценённых 12 клиницистами.
💥
Что получилось?
Фронтир-модели обошли клинические инструменты везде. На MedQA Gemini — 97,4% против 89,6% у OpenEvidence и 88,4% у UpToDate. На HealthBench разрыв ещё заметнее: GPT-5.2 — 88,0 против 61–63 у клинических инструментов.
Самое неприятное: в реальных запросах врачей клинические инструменты оказались не лучше, чем обычный AI-обзор в поиске Google. По безопасности значимой разницы не нашли — слабое место OpenEvidence оказалось не в знаниях, а в коммуникации: он зачастую давал неполные или сумбурные ответы.
Почему не стоит спешить с выводами🔶 Во-первых, OpenEvidence и UpToDate — продукты, а не модели; у них нет публичного API, их опрашивали вручную через браузер — это ограничение авторы честно оговаривают.
🔶 Во-вторых, HealthBench —
бенчмарк от OpenAI, и лучший результат на нём показала как раз модель OpenAI; авторы считают главным доказательством именно слепую оценку RCQ.
🔶 В-третьих, отмечается, что слабость OpenEvidence слабее всего именно
в ясности изложения, а не в фактической точности. Это инструмент, оптимизированный под быстрый ответ с цитатами источников на точечный клинический вопрос у постели больного. А RCQ-бенчмарк — это открытые, часто более сложные и многосоставные запросы врачей.
💥
Что из этого следуетДело не в том, что специализация — в целом плохая идея. Специализированные продукты пока строятся поверх более слабой базовой модели, и разрыв в инвестициях и данных фронтир-моделей, по всей видимости, перевешивает выигрыш от узкой настройки.
Практический вывод для нас всех: даже лейбл «clinical AI» пока не гарантия самого лучшего качества, а это — очередной повод не доверять ИИ слепо.
@FemtechForce — о технологиях для здоровья женщин
Текст подготовила #ОльгаТитова