TGViewer
Биомедтех с Аллой Панченко | SechenovTech Биомедтех с Аллой Панченко | SechenovTech @sechtech · 4.4K subscribers
Post #1638 574
ИИ vs врач: считаем "допустимый уровень ошибок" у Perplexity

Под постом про Perplexity Health мне написали: "нужно подождать данных реальной практики, насколько это окажется безопасным при использовании в широкой популяции". Справедливое замечание, которое заставило меня задуматься о том, как вообще оценивать "приемлемость" ошибок ИИ-систем в медицине.

Мы почему-то требуем от технологий идеальности, хотя сама медицина далека от нее. Так какой уровень ошибок был бы "нормальным" для ИИ-инструмента, чтобы он не бросался в глаза на фоне текущей медицинской практики?

Давайте попробуем это посчитать по открытым источникам, а потом попросим глубоко уважаемую мной коллегу прокомментировать это с позиции отечественной судмедэкспертизы Олеся Валерьевна, оч прошу! @medical_error_by_Veselkina

Baseline: сколько ошибаются врачи

Если опираться на исследования, опубликованные в последние годы, картина получается интересная.

Согласно данным крупного исследования, опубликованного в Harvard Medical School в 2024 году, средний уровень диагностических ошибок составляет 11.1%. Но это средняя температура по больнице — разброс огромный: от 1.5% для инфаркта миокарда до 62% для спинального абсцесса. То есть для некоторых состояний вероятность ошибочного диагноза превышает 50%.

Johns Hopkins Medicine в своем отчете 2023 года указывает, что 7% госпитализированных пациентов сталкиваются с вредными диагностическими ошибками — теми, которые приводят к реальным негативным последствиям. Ещё более тревожная цифра: среди критических пациентов в реанимации или умерших доля диагностических ошибок достигает 23%.

Метаисследование, опубликованное в BMJ, показывает, что каждый 14-й госпитализированный пациент сталкивается с вредной диагностической ошибкой. А NBC News в 2023 году опубликовал данные, согласно которым почти каждый четвертый госпитализированный пациент (23.6%) сталкивается с каким-либо неблагоприятным событием, из которых 7% — предотвратимые.

Это не обвинение врачей. Это объективная сложность медицины как дисциплины: неполные данные, атипичные проявления болезней, человеческая усталость, временные ограничения на прием.

А что с ИИ?

Здесь картина сильно зависит от того, о какой именно системе мы говорим.

Специализированные ИИ-системы диагностики показывают точность 85-92%, то есть уровень ошибок 8-15%. Это данные из нескольких независимых исследований, опубликованных в NIH PMC и других источниках. Например, Microsoft AI Diagnostic Orchestrator показал 85% точности на сложных клинических случаях из NEJM, тогда как врачи без помощи ИИ давали правильный ответ только в 20% случаев. TIME в 2025 году опубликовал материал об этом исследовании с говорящим заголовком "Microsoft's AI Is Better Than Doctors at Diagnosing Disease".

ChatGPT-4, протестированный на медицинских экзаменационных вопросах, набрал 92 балла против 74-76 у врачей. Российский Diagnocat в стоматологической диагностике показал 4.86% ошибок против 7.29% у врачей, работая при этом в 6 раз быстрее.

Базовая точность врачей в исследованиях оценивается в 73% — то есть 27% ошибок.

Но есть важный нюанс: медицинские чатботы общего назначения — совсем другая история. CIDRAP опубликовал в апреле 2026 года исследование, показавшее, что такие чатботы дают проблемные ответы в 49.6% случаев. ChatGPT на медицинских вопросах дает корректные ответы только в 57.8% случаев. При неполных входных данных уровень ошибок превышает 80%.

👻 Биомедтех в MAX
Harvard Gazette Research assesses rates, causes of diagnostic errors — Harvard Gazette In an analysis of electronic health records researchers found errors in assessing patients, or errors in ordering and interpreting diagnostic tests.
  • 🤔 4
  • ❤ 3
More from @sechtech
  1. Sep 22, 2026Приземлилась в Толмачево, впереди @openbio_ru Новосибирский Академгородок — одно из тех ме…
  2. Sep 20, 2026Цифровые трансцендентные докмед-практики Современная медицина, особенно в ее цифровой верс…
  3. Sep 20, 2026Тибетская медицина и стартапы по мотивам выставки в Пушкинском музее Продолжаем культурную…
  4. Sep 19, 2026Начали осенний театральный сезон сразу с двух уроков о том, как не надо делать продукт. 14…
  5. Sep 17, 2026Запускаем с партнерами исследование «Модель роста технологических проектов» Любая технолог…
  6. Sep 16, 2026А для самых смелых стартаперов из нашего каталога и не из нашего тоже @ArtgenBio придумали…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →