ИИ vs врач: считаем "допустимый уровень ошибок" у Perplexity
Под постом про Perplexity Health мне написали: "нужно подождать данных реальной практики, насколько это окажется безопасным при использовании в широкой популяции". Справедливое замечание, которое заставило меня задуматься о том, как вообще оценивать "приемлемость" ошибок ИИ-систем в медицине.
Мы почему-то требуем от технологий идеальности, хотя сама медицина далека от нее. Так какой уровень ошибок был бы "нормальным" для ИИ-инструмента, чтобы он не бросался в глаза на фоне текущей медицинской практики?
Давайте попробуем это посчитать по открытым источникам, а потом попросим глубоко уважаемую мной коллегу прокомментировать это с позиции отечественной судмедэкспертизы Олеся Валерьевна, оч прошу! @medical_error_by_Veselkina
Baseline: сколько ошибаются врачи
Если опираться на исследования, опубликованные в последние годы, картина получается интересная.
Согласно данным крупного исследования, опубликованного в Harvard Medical School в 2024 году, средний уровень диагностических ошибок составляет 11.1%. Но это средняя температура по больнице — разброс огромный: от 1.5% для инфаркта миокарда до 62% для спинального абсцесса. То есть для некоторых состояний вероятность ошибочного диагноза превышает 50%.
Johns Hopkins Medicine в своем отчете 2023 года указывает, что 7% госпитализированных пациентов сталкиваются с вредными диагностическими ошибками — теми, которые приводят к реальным негативным последствиям. Ещё более тревожная цифра: среди критических пациентов в реанимации или умерших доля диагностических ошибок достигает 23%.
Метаисследование, опубликованное в BMJ, показывает, что каждый 14-й госпитализированный пациент сталкивается с вредной диагностической ошибкой. А NBC News в 2023 году опубликовал данные, согласно которым почти каждый четвертый госпитализированный пациент (23.6%) сталкивается с каким-либо неблагоприятным событием, из которых 7% — предотвратимые.
Это не обвинение врачей. Это объективная сложность медицины как дисциплины: неполные данные, атипичные проявления болезней, человеческая усталость, временные ограничения на прием.
А что с ИИ?
Здесь картина сильно зависит от того, о какой именно системе мы говорим.
Специализированные ИИ-системы диагностики показывают точность 85-92%, то есть уровень ошибок 8-15%. Это данные из нескольких независимых исследований, опубликованных в NIH PMC и других источниках. Например, Microsoft AI Diagnostic Orchestrator показал 85% точности на сложных клинических случаях из NEJM, тогда как врачи без помощи ИИ давали правильный ответ только в 20% случаев. TIME в 2025 году опубликовал материал об этом исследовании с говорящим заголовком "Microsoft's AI Is Better Than Doctors at Diagnosing Disease".
ChatGPT-4, протестированный на медицинских экзаменационных вопросах, набрал 92 балла против 74-76 у врачей. Российский Diagnocat в стоматологической диагностике показал 4.86% ошибок против 7.29% у врачей, работая при этом в 6 раз быстрее.
Базовая точность врачей в исследованиях оценивается в 73% — то есть 27% ошибок.
Но есть важный нюанс: медицинские чатботы общего назначения — совсем другая история. CIDRAP опубликовал в апреле 2026 года исследование, показавшее, что такие чатботы дают проблемные ответы в 49.6% случаев. ChatGPT на медицинских вопросах дает корректные ответы только в 57.8% случаев. При неполных входных данных уровень ошибок превышает 80%.
👻 Биомедтех в MAX
Post #1638
574