🔥 ИИ занижает потребности женщин в соцопеке? И да, и нет. Что на самом деле показало исследование LSE
Привет! Меня зовут Ольга Титова, я работаю AI Product Manager, выступаю за безопасный и этичный подход к ИИ, и после небольшого перерыва снова делюсь с подписчиками Femtech Force интересными новостями из мира ИИ и здоровья.
На днях я увидела громкий заголовок: «Автоматизация неравенства: искусственный интеллект недооценивает потребности женщин в уходе». Звучит тревожно, но что происходит на самом деле? Разбираемся с первоисточником.
🔶 Что проверяли исследователи на самом деле?
Новость основа на академической статье. Исследователи из LSE взяли 617 кейсов пожилых людей из социальной опеки. Для каждой записи создали еще одну версию, в которой поменяли пол пациента, оставив все остальные данные идентичным. Затем четыре языковые модели — Llama 3, Gemma, BART и T5 — написали краткие резюме этих кейсов.
Цель: измерить, появятся ли системные различия в текстах только от смены пола при полностью одинаковых остальных данных.
🔶 Что они нашли? Различия есть — но только у одной современной модели
И это главный факт, который стоит проговорить, потому что заголовки эту деталь часто упускают. Модель Llama 3 от Meta показала нулевое гендерное смещение по всем метрикам. BART и T5 — уже не новые модели, у них есть некоторые смещения, но слабые и не системные. А вот для модели Gemma от Google различия оказались серьезными.
Что было не так у Gemma?
💥 Проблемы мужчин звучат серьезнее. В мужских резюме значительно чаще встречаются слова «нетрудоспособный», «не может», «сложная медицинская история». Те же проблемы у женщин превращается в мягкое: «проблемы со здоровьем», «требуется поддержка», «несмотря на ограничения, справляется…»
💥 Женские кейсы звучат обтекаемее, из них пропадает человек. Gemma чаще начинает резюме кейса женщины со слов: «В кейсе описывается…», «Текст подчёркивает…», а мужчины — «У мистера Смита…».
💥 Проблема с не связана с галлюцинациями. Исследователи проверили 1,599,264 возможных случая и нашли всего 18 галлюцинаций. Различия связаны именно с использованием более мягкого языка в женских кейсах.
Такое «смягчение» может привести к неравному распределению помощи в ситуациях, когда краткое саммари влияет на решение соцработника о скорости и объёме помощи.
🔶 Ограничения исследования
— Узкие данные: Только социальная опека, пожилые люди, один район Лондона (не медицина в широком смысле).
— Ограниченная задача: Генерация кратких резюме на 50–300 токенов.
— Метод работает не везде: Кейсы, связанные с домашним насилием или специфично женскими/мужскими состояниями, исключались. Это снижает универсальность выводов.
— Модели без настройки: LLM не дообучались и не модифицировались; в реальных системах, особенно в медицине, разработчики редко берут модель «как есть».
— Исследование не изучало реальные решения: Оно показывает сдвиги в текстах, но не изучает, как соцработники реально принимают решения на основе этих резюме.
Так насколько всё опасно?
На мой взгляд, главный вывод — не «ИИ автоматически вреден женщинам», а:
— Разные модели ведут себя очень по-разному;
— Важно проверять модели на гендерные перекосы;
— Проверять их нужно до интеграции, а не после.
Та же Llama 3 проходит тест безупречно, а Gemma — нет. Это не технология «в целом», а конкретные свойства конкретной модели в конкретной задаче.
💥 Почему это важно для femtech и здравоохранения?
Мы всё чаще видим, как ИИ входит в административные процессы: выписки, суммаризации, отчёты. И если такие инструменты становятся частью стандартного процесса, то мелкие лингвистические сдвиги могут превращаться в реальные решения о доступе к услугам.
Контролировать это — нормальная инженерная практика. Именно поэтому тестирование на fairness должно быть частью разработки любого медицинского ИИ-продукта.
➡️ Источники:
Evaluating gender bias in large language models in long-term care
Automating inequality: When AI undervalues women’s care needs
@FemtechForce — о технологиях для здоровья женщин
Текст подготовила #ОльгаТитова
Post #2951
1.09K

- ❤ 25
- 🕊 3