TGViewer
Femtech Force — новости, вакансии, подкаст Femtech Force — новости, вакансии, подкаст @femtechforce · 7.54K subscribers
Post #3534 2.5K
🔥 Где ИИ ломается в женском здоровье

Привет! Я Алина, врач-психиатр. На arXiv вышел бенчмарк по женскому здоровью — впервые системно проверили, как 13 LLM отвечают на такие вопросы. Спойлер: ни одна модель не надёжна во всех категориях

Women's Health Benchmark (WHB) собрал коллектив из 17 экспертов — врачи, фармацевты, исследовательницы из США, Великобритании и ЕС. Они задали 345 реалистичных вопросов случайно выбранной из 13 моделей и выделили 96 ответов с клинически опасной ошибкой — это и стал датасет, включающий 5 медицинских областей и 3 типа запросов: от пациентки, от клинициста, по доказательной базе и руководствам

💥 Процент ошибок

Средняя доля ошибочных ответов 13 моделей — около 60%.
Лучший — GPT-5 (53,1% правильных), за ним Gemini 3 Pro (47,9%) и o3 (46,9%).

Худшие — Ministral-8B (27,1%) и GPT-4o Mini (30,2%). Большие модели в среднем дают 44% правильных, маленькие — 34%. Дельта есть, но 44% всё равно мало

💥 Где ИИ ломается чаще всего

🔶 Неверный совет по лечению — 76,3% ошибок. Модель уверенно рекомендует то, что расходится с доказательной практикой

🔶 Устаревшие клинические рекомендации — 69,2%

🔶 Ошибки в дозировках и выборе препарата — 57,9%

🔶 Неуместные рекомендации — 57,7%. GPT-5, GPT-5.1, o3 и Gemini 3 Pro справляются заметно лучше, GPT-4o Mini и Mistral Large — почти всегда мимо

🔶 Пропущенные экстренные состояния — 53,8%. Универсально слабо во всех моделях

🔶 По специальностям: хуже всего неврология (76,9%, но малая выборка), за ней онкология (67,8%) и экстренная медицина (59,9%). Лучше — акушерство и гинекология (56,7%) и первичная помощь (57,5%), но это всё ещё больше половины ошибок

🔶 Пациентка vs клиницист: в среднем модели ошибаются одинаково. Но Grok 4, Ministral 8B и Gemini 3 Pro заметно лучше отвечают на клинические запросы, чем на вопросы от лица пациентки, формулировка влияет на качество

➡️ Что это значит, если вы строите femtech-продукт

🔶 Диверсифицируйте — маршрутизируйте по доменам при необходимости. Покрытие неравномерное: по данным авторов, Gemini 3 Pro лучше в акушерстве и гинекологии (48,8% ошибок), o3 силён в первичной помощи (41,2%), GPT-5 оказался наиболее универсальным

🔶 Неотложная помощь — отдельный слой, а не функция базовой модели. Раз все 13 моделей пропускают её в каждом втором случае, триаж нужно делать вне LLM: тревожные признаки по правилам, чек-лист симптомов, обязательная эскалация к клиницисту при триггерах

🔶 Дозировки — самый высокий риск ответственности. Free-form вывод по дозам нельзя отдавать пользователю без валидационного слоя: structured output, сверка с фармакологической базой, межлекарственные взаимодействия и отдельные правила для особых физиологических состояний (беременности, лактации и т. д.)

🔶 Регистр запроса — отдельная переменная качества. Модели отвечают на клинический запрос заметно лучше, чем на тот же по сути запрос от лица пациентки. Между пользовательницей и моделью нужен слой переформулировки: structured intake формой или LLM-препроцессором, который превращает жалобу в клинический вопрос с возрастом, анамнезом и явным симптомокомплексом

WHB — первая попытка системно показать, что в женском здоровье ИИ пока не «надёжный советчик». Сейчас эти данные составляют для индустрии карту продуктовых возможностей

@FemtechForce — о технологиях для здоровья женщин

Текст подготовила #АлинаАкбашева
  • ❤ 28
  • 👍 7
  • 🤔 2
  • 💔 1
More from @femtechforce
  1. Sep 29, 2026Что лучше всего помогает женщинам спать? Вы ждали этот метаанализ Привет, друзья! Сегодня…
  2. Sep 25, 2026Дайджест фемтех-вакансий за неделю 💥Marketplaces Lead — Whoop Компания, создающая wearabl…
  3. Sep 25, 2026Наша исследовательница Алина Акбашева выступит на Vibe & Code Команда Femtech Force очень…
  4. Sep 25, 2026Post #3764
  5. Sep 24, 2026ЭТИ ДНИ в Белграде: «Ну и кто я теперь? Профессиональная реализация женщин в эмиграции» Пр…
  6. Sep 24, 2026Post #3762
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →