💫«Галлюцинации» медицинских LLM
Привет! Я Алина, врач‑психиатр. Сегодня разберёмся, почему большие языковые модели (LLM) выдают опасные ошибки — и что с этим делать.
Недавно вышел интересный препринт (статья ещё не прошла рецензирование) на arXiv, где основным отличием от когнитивных ошибок врача‑клинициста авторы указывают неправильное обучение или пробелы в данных.
Что такое галлюцинация в данном контексте?
Исследователи предлагают простое определение: модель «галлюцинирует», когда выдаёт заведомо неверный или вводящий в заблуждение медицинский факт, способный ухудшить клиническое решение.
Ошибки делят на пять основных групп:
• Фактические — неверные дозы и т. д.
• Устаревшие данные — ссылка на протокол 2010 г. вместо актуального.
• Ложные корреляции — склеивание несвязанных фактов (например, местное введение инсулина для лечения инфекции).
• Выдуманные источники — ссылка на несуществующее «исследование III фазы».
• Логические ошибки — неверная цепочка клинических рассуждений.
💥 Кто галлюцинирует чаще: краткий рейтинг Med‑HALT
Учёные протестировали модели на открытом бенчмарке Med‑HALT, который проверяет логическое мышление и фактическую память.
• Лучший результат: Gemini 2.0‑Thinking — в среднем около 2% неверных ответов.
• Следом идут deepseek‑R1 и o3‑mini (≈ 5% без доработок).
• Узкоспециализированные модели вроде PMC‑LLaMA и MedAlpaca начинают уже с 40–60% промахов и даже после тюнинга остаются позади универсальных лидеров.
💥 Что реально помогает
1. Свежие корпуса (например, MEDITRON‑70B) и целевое расширение редких случаев.
2. Дообучение с поправкой знаний или выборочное редактирование после обучения.
3. Retrieval‑Augmented Generation (RAG) с проверенными базами вроде MedRAG.
4. Chain‑of‑Thought: просим модель рассуждать пошагово — минус 10–30% ошибок.
5. Запрос оценки уверенности.
6. Использование нескольких LLM: расхождение ответов служит красным флагом.
Выводы
С одной стороны, 91,8% опрошенных в статье врачей уже сталкивались с «галлюцинацией» ИИ, что сопоставимо с собственными диагностическими искажениями клиницистов. Но также почти 90% тех же специалистов считают LLM полезными, потому что они ускоряют поиск литературы, резюмируют истории болезни и помогают формировать дифференциальный ряд.
Эти цифры показывают, что сегодня полная автоматизация медицины пока невозможна: только при условии «человека в цикле» ИИ станет надёжным ассистентом.
➡️ Источник
Текст подготовила #АлинаАкбашева
@FemtechForce — технологии для здоровья женщин
Post #2690
1.64K
- 🔥 22
- 👍 9
- ❤ 7