🔥 Где ИИ ломается в женском здоровье
Привет! Я Алина, врач-психиатр. На arXiv вышел бенчмарк по женскому здоровью — впервые системно проверили, как 13 LLM отвечают на такие вопросы. Спойлер: ни одна модель не надёжна во всех категориях
Women's Health Benchmark (WHB) собрал коллектив из 17 экспертов — врачи, фармацевты, исследовательницы из США, Великобритании и ЕС. Они задали 345 реалистичных вопросов случайно выбранной из 13 моделей и выделили 96 ответов с клинически опасной ошибкой — это и стал датасет, включающий 5 медицинских областей и 3 типа запросов: от пациентки, от клинициста, по доказательной базе и руководствам
💥 Процент ошибок
Средняя доля ошибочных ответов 13 моделей — около 60%.
Лучший — GPT-5 (53,1% правильных), за ним Gemini 3 Pro (47,9%) и o3 (46,9%).
Худшие — Ministral-8B (27,1%) и GPT-4o Mini (30,2%). Большие модели в среднем дают 44% правильных, маленькие — 34%. Дельта есть, но 44% всё равно мало
💥 Где ИИ ломается чаще всего
🔶 Неверный совет по лечению — 76,3% ошибок. Модель уверенно рекомендует то, что расходится с доказательной практикой
🔶 Устаревшие клинические рекомендации — 69,2%
🔶 Ошибки в дозировках и выборе препарата — 57,9%
🔶 Неуместные рекомендации — 57,7%. GPT-5, GPT-5.1, o3 и Gemini 3 Pro справляются заметно лучше, GPT-4o Mini и Mistral Large — почти всегда мимо
🔶 Пропущенные экстренные состояния — 53,8%. Универсально слабо во всех моделях
🔶 По специальностям: хуже всего неврология (76,9%, но малая выборка), за ней онкология (67,8%) и экстренная медицина (59,9%). Лучше — акушерство и гинекология (56,7%) и первичная помощь (57,5%), но это всё ещё больше половины ошибок
🔶 Пациентка vs клиницист: в среднем модели ошибаются одинаково. Но Grok 4, Ministral 8B и Gemini 3 Pro заметно лучше отвечают на клинические запросы, чем на вопросы от лица пациентки, формулировка влияет на качество
➡️ Что это значит, если вы строите femtech-продукт
🔶 Диверсифицируйте — маршрутизируйте по доменам при необходимости. Покрытие неравномерное: по данным авторов, Gemini 3 Pro лучше в акушерстве и гинекологии (48,8% ошибок), o3 силён в первичной помощи (41,2%), GPT-5 оказался наиболее универсальным
🔶 Неотложная помощь — отдельный слой, а не функция базовой модели. Раз все 13 моделей пропускают её в каждом втором случае, триаж нужно делать вне LLM: тревожные признаки по правилам, чек-лист симптомов, обязательная эскалация к клиницисту при триггерах
🔶 Дозировки — самый высокий риск ответственности. Free-form вывод по дозам нельзя отдавать пользователю без валидационного слоя: structured output, сверка с фармакологической базой, межлекарственные взаимодействия и отдельные правила для особых физиологических состояний (беременности, лактации и т. д.)
🔶 Регистр запроса — отдельная переменная качества. Модели отвечают на клинический запрос заметно лучше, чем на тот же по сути запрос от лица пациентки. Между пользовательницей и моделью нужен слой переформулировки: structured intake формой или LLM-препроцессором, который превращает жалобу в клинический вопрос с возрастом, анамнезом и явным симптомокомплексом
WHB — первая попытка системно показать, что в женском здоровье ИИ пока не «надёжный советчик». Сейчас эти данные составляют для индустрии карту продуктовых возможностей
@FemtechForce — о технологиях для здоровья женщин
Текст подготовила #АлинаАкбашева
Post #3534
2.5K
- ❤ 28
- 👍 7
- 🤔 2
- 💔 1