💻Исследование выявило формирование зависимости из-за льстивого поведения ИИ.
Согласно исследованию, опубликованному в журнале Science, искусственный интеллект (ИИ) склонен чрезмерно соглашаться с пользователями даже в ситуациях, когда те описывают аморальные или незаконные действия. Такое поведение ИИ, называемое сикофантией, приводит к тому, что люди начинают считать себя «более правыми» и реже готовы идти на примирение в конфликтах.
Группа исследователей провела масштабную работу, чтобы выяснить, насколько распространена так называемая «социальная сикофантия» (стремление угождать, льстить и безоговорочно поддерживать собеседника) среди современных больших языковых моделей и к каким последствиям это приводит для пользователей.
Ученые проанализировали поведение 11 ведущих языковых моделей, включая GPT-4o (OpenAI), Claude (Anthropic), Gemini (Google), а также открытые модели Llama-3, Qwen, DeepSeek и Mistral.
Результаты показали, что ИИ в среднем одобрял действия пользователя на 49% чаще, чем люди, которые участвовали в эксперименте для сравнения. Особенно показательными оказались случаи, где человеческий консенсус однозначно осуждал поведение автора. В таких ситуациях, когда сообщество выносило вердикт «Ты неправ», современные модели ИИ в 51% случаев выражали поддержку пользователю. При этом даже в сценариях, где запрос описывал обман, причинение вреда или незаконные действия, средний уровень одобрения со стороны ИИ составил 47%.
Вот к каким выводам пришли исследователи:
— Участники, общавшиеся с льстивым ИИ, были значительно больше уверены, что они «правы» в конфликте. В гипотетических сценариях этот показатель вырос на 62%, а в разговоре о реальных конфликтах — на 25%.
— У тех же участников значительно снижалась готовность предпринимать шаги для восстановления отношений (извиняться, менять свое поведение). Снижение составило от 10% до 28% в зависимости от формата эксперимента.
— Анализ показал, что льстивые ответы ИИ значительно реже упоминали точку зрения другой стороны конфликта, сосредотачиваясь исключительно на позиции пользователя.
Несмотря на то, что льстивые ответы искажали суждения пользователей, они казались им гораздо более привлекательными. Участники стабильно оценивали их как более качественные, вызывали больше доверия и выражали большее желание обратиться к такой системе снова.
Авторы исследования подчеркивают, что сложившаяся ситуация создает «извращенные стимулы». Поскольку пользователи предпочитают и больше доверяют льстивым системам, разработчики, ориентируясь на метрики вовлеченности и удовлетворенности, не заинтересованы в уменьшении этой функции, даже если она несет в себе риски.
Post #2246
1.89K