TGViewer
Femtech Force — новости, вакансии, подкаст Femtech Force — новости, вакансии, подкаст @femtechforce · 7.57K subscribers
Post #2690 1.64K
💫«Галлюцинации» медицинских LLM

Привет! Я Алина, врач‑психиатр. Сегодня разберёмся, почему большие языковые модели (LLM) выдают опасные ошибки — и что с этим делать.

Недавно вышел интересный препринт (статья ещё не прошла рецензирование) на arXiv, где основным отличием от когнитивных ошибок врача‑клинициста авторы указывают неправильное обучение или пробелы в данных.

Что такое галлюцинация в данном контексте?

Исследователи предлагают простое определение: модель «галлюцинирует», когда выдаёт заведомо неверный или вводящий в заблуждение медицинский факт, способный ухудшить клиническое решение.

Ошибки делят на пять основных групп:

• Фактические — неверные дозы и т. д.
• Устаревшие данные — ссылка на протокол 2010 г. вместо актуального.
• Ложные корреляции — склеивание несвязанных фактов (например, местное введение инсулина для лечения инфекции).
• Выдуманные источники — ссылка на несуществующее «исследование III фазы».
• Логические ошибки — неверная цепочка клинических рассуждений.

💥 Кто галлюцинирует чаще: краткий рейтинг Med‑HALT

Учёные протестировали модели на открытом бенчмарке Med‑HALT, который проверяет логическое мышление и фактическую память.

• Лучший результат: Gemini 2.0‑Thinking — в среднем около 2% неверных ответов.
• Следом идут deepseek‑R1 и o3‑mini (≈ 5% без доработок).
• Узкоспециализированные модели вроде PMC‑LLaMA и MedAlpaca начинают уже с 40–60% промахов и даже после тюнинга остаются позади универсальных лидеров.

💥 Что реально помогает

1. Свежие корпуса (например, MEDITRON‑70B) и целевое расширение редких случаев.
2. Дообучение с поправкой знаний или выборочное редактирование после обучения.
3. Retrieval‑Augmented Generation (RAG) с проверенными базами вроде MedRAG.
4. Chain‑of‑Thought: просим модель рассуждать пошагово — минус 10–30% ошибок.
5. Запрос оценки уверенности.
6. Использование нескольких LLM: расхождение ответов служит красным флагом.

Выводы

С одной стороны, 91,8% опрошенных в статье врачей уже сталкивались с «галлюцинацией» ИИ, что сопоставимо с собственными диагностическими искажениями клиницистов. Но также почти 90% тех же специалистов считают LLM полезными, потому что они ускоряют поиск литературы, резюмируют истории болезни и помогают формировать дифференциальный ряд.

Эти цифры показывают, что сегодня полная автоматизация медицины пока невозможна: только при условии «человека в цикле» ИИ станет надёжным ассистентом.

➡️ Источник

Текст подготовила #АлинаАкбашева

@FemtechForce — технологии для здоровья женщин
  • 🔥 22
  • 👍 9
  • ❤ 7
More from @femtechforce
  1. Oct 8, 2026🔥 Véa: AI-дневник, который учит женщин понимать свой разум и при этом не заменяет терапию…
  2. Oct 6, 2026Рынок технологий для женского здоровья в Казахстане вырастет до 617 млрд тенге к 2031 году…
  3. Oct 5, 2026💯 Каждая третья молодая американка ни разу не проходила скрининг на рак шейки матки В JAM…
  4. Oct 2, 2026Дайджест фемтех-вакансий за неделю 💥 Finance & Operations Manager — Lóvi Lóvi — AI-компан…
  5. Oct 2, 2026🔥 Австралийская биотех-компания Kinoxis Therapeutics привлекла $9,25 млн на разработку пр…
  6. Oct 1, 2026Ищем героинь для статьи о менопаузе Привет! На связи Саша — контент-лид Femtech Force. Сов…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →