Советы от ИИ
Чат-боты на основе искусственного интеллекта быстро вошли в повседневную жизнь, часто используясь для решения вопросов, касающихся здоровья. Однако, несмотря на их широкое применение и прогресс в LLM-моделях, сохраняются опасения по поводу точности выдаваемых ИИ ответов.
Предыдущие исследования по этой теме показали противоречивые результаты: в одних работах чат-боты были в основном точны, в то время как в других сообщалось о частых ошибках и риске распространения дезинформации.
В этом исследовании авторы поставили перед собой довольно простую задачу — «провести аудит пяти популярных чат-ботов на основе искусственного интеллекта, чтобы оценить их ответы на повседневные вопросы о здоровье и медицине в нескольких областях, наиболее чувствительных к распространению дезинформации».
Ученые взяли 5 общедоступных ИИ — Gemini, DeepSeek, Meta AI, ChatGPT и Grok, предложив им по 50 вопросов в пяти категориях: рак, вакцины, стволовые клетки, питание и тренировки, как в формате открытых, так и закрытых вопросов.
Для того чтобы склонить модели к предоставлению дезинформации или противоречивым рекомендациям, использовалась «состязательная модель»; ответы были независимо оценены двумя экспертами в данной области как не вызывающие проблем, несколько проблематичные или крайне проблематичные.
Цитируемые источники оценивались на предмет подлинности и полноты, а читабельность оценивалась с помощью индекса легкости чтения Флеша.
Показатель полноты — метрика качества, определяющая, насколько полно представлены необходимые данные для решения поставленной задачи.
Почти половина всех ответов (49,6%) были проблематичны, 30% — умеренно проблематичны и 19,6% — крайне проблематичны, при этом ответы по питанию и тренировкам были самыми плохими, а Grok показал значительно больше крайне проблематичных ответов, чем ожидалось.
Качество ссылок было низким для всех ИИ: медианный показатель полноты составил всего 40%, ни один чат-бот не выдал полностью точный список ссылок, а фальсифицированные или вымышленные цитаты встречались часто.
Все чат-боты выдавали ответы, оцененные как «сложные» по шкале Флеша, что соответствует уровню колледжа, а сами ответы всегда выдавались с неизменной уверенностью, независимо от их точности, при этом из 250 ответов, отказов отвечать было лишь два.
Что по этому поводу сказали авторы исследования?
- Дальнейшее внедрение чат-ботов с ИИ без просвещения общественности и регулирующего надзора рискует усилить дезинформацию в сфере здравоохранения, особенно в таких областях, как питание и тренировки, где проблемные ответы были наиболее часты.
- Авторы призывают к проведению просветительской работы среди населения, профессиональной подготовке и регулирующему надзору, чтобы гарантировать, что генеративный ИИ будет способствовать укреплению, а не подрывать общественное здоровье.
Итого, исследование показало, что почти половина ответов пяти популярных чат-ботов с ИИ на вопросы о здоровье и медицине были неточными, вводящими в заблуждение или неполными, при этом ссылки часто были сфабрикованными или недостоверными.
Проблема наиболее остро стояла на вопросах о питании и тренировках.
При этом чат-боты отвечали уверенно, независимо от точности информации, и редко отказывались отвечать.
Рекомендация для спортсменов — относиться к информации о здоровье, полученной с помощью ИИ, со значительным скептицизмом и проверять важные утверждения у настоящих экспертов или в рецензируемых научных источниках.
Возможно, есть некоторая польза от получения идей и первоначальной информации от ИИ, но помимо этого имеет смысл обратиться за помощью к реальному эксперту.
Post #3385
4.92K

- 👍 30
- ❤ 17
- 🔥 3