ИИ отговаривает пациентов обращаться к врачам, и чем больше опечаток они делают в запросах, тем чаще это происходит. Ученые из MIT выяснили, что LLM чрезвычайно чувствительны к стилю текста, и даже лишний пробел может повлиять на рекомендации по вопросам здоровья.
Исследователи протестировали 4 ИИ (ChatCPT, Llama-3-8B, Llama-3-70B и Palmyra Med) на запросах пациентов с различными симптомами. Сначала они получили ответ на эти запросы в нейтральной форме для контроля, затем внесли незначительные изменения в текст: восклицательные знаки, орфографические ошибки, лишние пробелы или отсутствие заглавных букв. Авторы также добавили эмоциональные выражения вроде “вау” и “боже мой” и формулировки, подразумевающие неуверенность: “может быть”, “я думаю” и т.д.
Исследование проверяло, как часто ИИ советует посетить врача на основании описанных симптомов. Выяснилось, что каждое из этих изменений заставляет ИИ на 7-9% чаще отговаривать пациента обращаться за медицинской помощью и вместо этого предлагать самолечение. Когда “пациент” описывал свои симптомы не в одном сообщении, а в ходе диалога, проблема усугублялась еще больше.
Это показывает, почему рано обольщаться по поводу LLM, якобы сдающих медицинские экзамены лучше, чем настоящие врачи:
✳️ Они все еще не готовы к взаимодействию с реальными пациентами, которые редко следуют формальному стилю и предпочитают диалоги.
✳️ “Наказание” пользователя за ошибки и опечатки отражает общественную предвзятость, которую ИИ усваивает в процессе обучения. Неграмотность характерна для малообразованных и иноязычных слоев населения, например, мигрантов, которым чаще отказывают в медицинском обслуживании из-за неплатежеспособности или миграционного статуса. Обученный на предвзятых данных ИИ делает вывод, что пишущему с ошибками пользователю не стоит посещать врача - чем поощряет самолечение пациентов, которым нужна неотложная помощь.
Что касается медицинских экзаменов, здесь ИИ тоже достигают успеха только в стандартных условиях. Если они меняются, даже незначительно, модель сразу начинает теряться. Ученые из Стэнфордского университета провели эксперимент, заменив в тесте правильные ответы на “ни один из вариантов”. 6 LLM, на которых проводилось исследование, хорошо справлялись с базовой версией теста: от 95,59% правильных ответов у o3-mini до 80,88% у Llama-3.3-70B.
Изменения условий в тесте были минимальными, и “подловить” экзаменуемого, который действительно обладает знаниями, на этом бы не удалось. Но результаты оказались удивительными: точность в среднем упала на 26,7%.
Лучше остальных справились DeepSeek (его результат снизился на 8,82%), o3-mini (16,18%) и Claude (26,47%), хотя этот итог тоже сложно назвать блестящим. Остальные потеряли более 30%: Gemini ошибся в ответах еще на 23 вопроса из 68 по сравнению со своим базовым результатом, GPT-4o - на 25 вопросов, Llama - на 26 вопросов. Точность двух последних ИИ в измененном тесте упала ниже 50%, и результаты мало чем отличались от случайных догадок.
Какие выводы из этого можно сделать? Если хотите получить адекватный совет по здоровью от ИИ, то вооружитесь орфографическим словарем, не ставьте лишних пробелов и формулируйте вопрос формально, как на экзамене. Возможно, это увеличит ваши шансы, но это не точно.
Post #581
3.4K