TGViewer
Femtech Force — новости, вакансии, подкаст Femtech Force — новости, вакансии, подкаст @femtechforce · 7.53K subscribers
Post #3617 1.23K
Специализированный медицинский ИИ проиграл универсальным чат-ботам. Но не торопитесь с выводами

Привет! Меня зовут Ольга Титова, я AI Product Manager, выступаю за безопасный и этичный подход к ИИ, и каждую неделю делюсь с подписчиками Femtech Force новостями из мира ИИ и здоровья.

Сегодня — исследование в Nature Medicine, которое в индустрии встретили громко, но, как мне кажется, местами восприняли слишком однозначно.

💥 Что проверяли?

Команда NYU Langone сравнила клинические ИИ-инструменты OpenEvidence и UpToDate Expert AI с тремя фронтир-моделями: GPT-5.2, Gemini 3.1 Pro и Claude Opus 4.6.

Это не нишевые продукты: по собственным заявлениям компании, OpenEvidence — самое быстрорастущее приложение для врачей в истории, а независимо подтверждённая оценка $12 млрд и использование в практике больше, чем половиной врачей США впечатляют не меньше.

Оценка шла в три этапа: общие медзнания (MedQA), согласованность с врачами (HealthBench) и главное — 100 реальных запросов врачей из живой практики (RCQ), вслепую оценённых 12 клиницистами.

💥 Что получилось?

Фронтир-модели обошли клинические инструменты везде. На MedQA Gemini — 97,4% против 89,6% у OpenEvidence и 88,4% у UpToDate. На HealthBench разрыв ещё заметнее: GPT-5.2 — 88,0 против 61–63 у клинических инструментов.

Самое неприятное: в реальных запросах врачей клинические инструменты оказались не лучше, чем обычный AI-обзор в поиске Google. По безопасности значимой разницы не нашли — слабое место OpenEvidence оказалось не в знаниях, а в коммуникации: он зачастую давал неполные или сумбурные ответы.

Почему не стоит спешить с выводами

🔶 Во-первых, OpenEvidence и UpToDate — продукты, а не модели; у них нет публичного API, их опрашивали вручную через браузер — это ограничение авторы честно оговаривают.
🔶 Во-вторых, HealthBench — бенчмарк от OpenAI, и лучший результат на нём показала как раз модель OpenAI; авторы считают главным доказательством именно слепую оценку RCQ.
🔶 В-третьих, отмечается, что слабость OpenEvidence слабее всего именно в ясности изложения, а не в фактической точности. Это инструмент, оптимизированный под быстрый ответ с цитатами источников на точечный клинический вопрос у постели больного. А RCQ-бенчмарк — это открытые, часто более сложные и многосоставные запросы врачей.

💥 Что из этого следует

Дело не в том, что специализация — в целом плохая идея. Специализированные продукты пока строятся поверх более слабой базовой модели, и разрыв в инвестициях и данных фронтир-моделей, по всей видимости, перевешивает выигрыш от узкой настройки.

Практический вывод для нас всех: даже лейбл «clinical AI» пока не гарантия самого лучшего качества, а это — очередной повод не доверять ИИ слепо.

@FemtechForce — о технологиях для здоровья женщин

Текст подготовила #ОльгаТитова
  • ❤ 11
  • 💔 4
  • 👀 1
More from @femtechforce
  1. Sep 24, 2026Post #3762
  2. Sep 23, 2026💥 Для чего женскому организму жировая ткань Всем привет! Это Катя Шемякинская, я пишу об…
  3. Sep 21, 2026💸 $21 млн, чтобы понять, почему лекарства действуют по-разному на женщин и мужчин Один и…
  4. Sep 20, 2026🚿 Включаем «Холодный душ» Сегодня хотим рассказать об открытом community-based пространст…
  5. Sep 18, 2026Дайджест фемтех-вакансий за неделю 💥 Product Manager — Beeone Ищут продакта для приложени…
  6. Sep 17, 2026Post #3757
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →