TGViewer
ВИРУСНАЯ НАГРУЗКА ВИРУСНАЯ НАГРУЗКА @viralload · 4.31K subscribers
Post #581 3.4K
ИИ отговаривает пациентов обращаться к врачам, и чем больше опечаток они делают в запросах, тем чаще это происходит. Ученые из MIT выяснили, что LLM чрезвычайно чувствительны к стилю текста, и даже лишний пробел может повлиять на рекомендации по вопросам здоровья.

Исследователи протестировали 4 ИИ (ChatCPT, Llama-3-8B, Llama-3-70B и Palmyra Med) на запросах пациентов с различными симптомами. Сначала они получили ответ на эти запросы в нейтральной форме для контроля, затем внесли незначительные изменения в текст: восклицательные знаки, орфографические ошибки, лишние пробелы или отсутствие заглавных букв. Авторы также добавили эмоциональные выражения вроде “вау” и “боже мой” и формулировки, подразумевающие неуверенность: “может быть”, “я думаю” и т.д.

Исследование проверяло, как часто ИИ советует посетить врача на основании описанных симптомов. Выяснилось, что каждое из этих изменений заставляет ИИ на 7-9% чаще отговаривать пациента обращаться за медицинской помощью и вместо этого предлагать самолечение. Когда “пациент” описывал свои симптомы не в одном сообщении, а в ходе диалога, проблема усугублялась еще больше.

Это показывает, почему рано обольщаться по поводу LLM, якобы сдающих медицинские экзамены лучше, чем настоящие врачи:
✳️ Они все еще не готовы к взаимодействию с реальными пациентами, которые редко следуют формальному стилю и предпочитают диалоги.
✳️ “Наказание” пользователя за ошибки и опечатки отражает общественную предвзятость, которую ИИ усваивает в процессе обучения. Неграмотность характерна для малообразованных и иноязычных слоев населения, например, мигрантов, которым чаще отказывают в медицинском обслуживании из-за неплатежеспособности или миграционного статуса. Обученный на предвзятых данных ИИ делает вывод, что пишущему с ошибками пользователю не стоит посещать врача - чем поощряет самолечение пациентов, которым нужна неотложная помощь.

Что касается медицинских экзаменов, здесь ИИ тоже достигают успеха только в стандартных условиях. Если они меняются, даже незначительно, модель сразу начинает теряться. Ученые из Стэнфордского университета провели эксперимент, заменив в тесте правильные ответы на “ни один из вариантов”. 6 LLM, на которых проводилось исследование, хорошо справлялись с базовой версией теста: от 95,59% правильных ответов у o3-mini до 80,88% у Llama-3.3-70B.

Изменения условий в тесте были минимальными, и “подловить” экзаменуемого, который действительно обладает знаниями, на этом бы не удалось. Но результаты оказались удивительными: точность в среднем упала на 26,7%.

Лучше остальных справились DeepSeek (его результат снизился на 8,82%), o3-mini (16,18%) и Claude (26,47%), хотя этот итог тоже сложно назвать блестящим. Остальные потеряли более 30%: Gemini ошибся в ответах еще на 23 вопроса из 68 по сравнению со своим базовым результатом, GPT-4o - на 25 вопросов, Llama - на 26 вопросов. Точность двух последних ИИ в измененном тесте упала ниже 50%, и результаты мало чем отличались от случайных догадок.

Какие выводы из этого можно сделать? Если хотите получить адекватный совет по здоровью от ИИ, то вооружитесь орфографическим словарем, не ставьте лишних пробелов и формулируйте вопрос формально, как на экзамене. Возможно, это увеличит ваши шансы, но это не точно.
More from @viralload
  1. Sep 23, 2026Ученые Стэнфордского университета создали мышей с частично человеческим мозгом. Их цель -…
  2. Sep 18, 2026Сотни крупных лабораторий по всему миру годами использовали неправильные антитела для иссл…
  3. Sep 16, 2026Американский фармрынок снова готов наступить на грабли опиоидной эпидемии: компания Defini…
  4. Sep 11, 2026У Novartis выдалось несколько тяжелых недель: сначала пелакарсен провалился в фазе III, по…
  5. Sep 9, 2026Мы уже обсуждали, что в ситуациях, когда ИИ составляет медицинские записи, а врач подписыв…
  6. Sep 4, 202631 августа вышел интересный препринт, который показал, что ИИ для медицинских записей (AI…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →