Так сколько ошибок допустимо для ИИ в медицине?
Разница принципиальная: специализированные системы обучены на медицинских данных, используют клинические протоколы и структурированный подход. Общие LLM — это болтуны, которые могут быть опасны.
Какой уровень ошибок был бы приемлемым?
Если мы хотим, чтобы ИИ-инструмент "не бросался в глаза" на фоне существующей практики, можно выделить три порога:
Либеральный порог: ≤ 11.1% — средний уровень диагностических ошибок. Если ИИ ошибается меньше или столько же, как средний врач, это уже не хуже существующего стандарта.
Умеренный порог: ≤ 7% — уровень вредных диагностических ошибок и предотвратимых неблагоприятных событий. Здесь планка выше, но всё ещё реалистичная.
Консервативный порог: ≤ 5% — уровень, который был бы значительно лучше текущей практики.
По этим критериям:
⏺ Специализированные ИИ-системы (8-15% ошибок) находятся в коридоре между либеральным и умеренным порогом — сопоставимы с врачебной практикой
⏺ ChatGPT и общие медицинские чатботы (40-50% проблемных ответов) в 4-6 раз хуже любого приемлемого стандарта
Что это значит для Perplexity Health?
Ключевой вопрос: что именно под капотом? Если Perplexity использует специализированные медицинские модели, интегрирует клинические гайдлайны и структурирует данные — можно ожидать уровень ошибок 8-15%, что вполне сопоставимо с врачебной практикой.
Если это просто GPT с доступом к вашим анализам — ждите 40-50% ошибок, что катастрофически плохо.
И здесь важно понимать позиционирование: Perplexity Health — это не замена врача, а инструмент для информированного диалога. Персонализированный саммари перед визитом, агрегация данных из разных источников, интерпретация трендов. В этой парадигме даже 15% ошибок не фатальны — финальное решение всё равно за врачом.
Главный тезис, который меня беспокоит
Фраза "нужно подождать данных реальной практики" звучит разумно, но упускает ключевое: мы УЖЕ ждем данных реальной практики от существующей медицины, которая показывает 11% диагностических ошибок.
Вопрос не в том, "безопасно ли это абсолютно", а в том, "безопаснее ли это того, что есть сейчас". И если специализированный ИИ ошибается в 8-10% случаев против 11% у врачей (или 27% базовой точности) — это уже конкурентоспособный уровень.
Системы здравоохранения проиграют эту гонку не потому, что ИИ-инструменты опасны или недостаточно протестированы. Они проиграют, потому что они удобны. Пациент получает ценность здесь и сейчас — не через три недели ожидания записи к терапевту, не после хождения по кабинетам за анализами, которые никто не сводит в единую картину.
Риск в том, что пока мы будем выстраивать идеальные протоколы безопасности и ждать долгосрочных исследований, рынок персонализированной медицинской аналитики сформируется без участия классических систем здравоохранения. И мы снова окажемся на обочине.
P.S. Вопрос к Олесе Валерьевне
@medical_error_by_Veselkina
Несколько вопросов к вам от меня и, думаю, от многих коллег:
Во-первых, совпадают ли эти цифры (11% средний уровень диагностических ошибок, 7% вредных ошибок) с тем, что обсуждалось, например, на недавнем конгрессе по судмедэкспертизе в МОНИКИ? Или российская статистика показывает другие значения?
Во-вторых, насколько вообще корректно ставить знак равенства между ошибками врачей и "ошибками" ИИ-систем в таком сравнительном анализе? Может, я вообще не так рассуждаю, и эти метрики несопоставимы?
И в-третьих — какой уровень ошибок ИИ-инструмента был бы для вас, как для эксперта по врачебным ошибкам, приемлемым для использования в качестве вспомогательного инструмента (именно вспомогательного, не заменяющего врача)? Есть ли вообще такой порог, или любое использование ИИ в медицинском контексте на текущем этапе преждевременно?
Будем крайне признательны за экспертное мнение!
👻 Биомедтех в MAX
Post #1639
498
- 🔥 6
- 👍 4
- 💯 2
- 👌 1