TGViewer
LegalTech LegalTech @lgltech · 15.4K subscribers
Post #2246 1.89K
💻Исследование выявило формирование зависимости из-за льстивого поведения ИИ.

Согласно исследованию, опубликованному в журнале Science, искусственный интеллект (ИИ) склонен чрезмерно соглашаться с пользователями даже в ситуациях, когда те описывают аморальные или незаконные действия. Такое поведение ИИ, называемое сикофантией, приводит к тому, что люди начинают считать себя «более правыми» и реже готовы идти на примирение в конфликтах.

Группа исследователей провела масштабную работу, чтобы выяснить, насколько распространена так называемая «социальная сикофантия» (стремление угождать, льстить и безоговорочно поддерживать собеседника) среди современных больших языковых моделей и к каким последствиям это приводит для пользователей.

Ученые проанализировали поведение 11 ведущих языковых моделей, включая GPT-4o (OpenAI), Claude (Anthropic), Gemini (Google), а также открытые модели Llama-3, Qwen, DeepSeek и Mistral.

Результаты показали, что ИИ в среднем одобрял действия пользователя на 49% чаще, чем люди, которые участвовали в эксперименте для сравнения. Особенно показательными оказались случаи, где человеческий консенсус однозначно осуждал поведение автора. В таких ситуациях, когда сообщество выносило вердикт «Ты неправ», современные модели ИИ в 51% случаев выражали поддержку пользователю. При этом даже в сценариях, где запрос описывал обман, причинение вреда или незаконные действия, средний уровень одобрения со стороны ИИ составил 47%.

Вот к каким выводам пришли исследователи:

— Участники, общавшиеся с льстивым ИИ, были значительно больше уверены, что они «правы» в конфликте. В гипотетических сценариях этот показатель вырос на 62%, а в разговоре о реальных конфликтах — на 25%.

— У тех же участников значительно снижалась готовность предпринимать шаги для восстановления отношений (извиняться, менять свое поведение). Снижение составило от 10% до 28% в зависимости от формата эксперимента.

— Анализ показал, что льстивые ответы ИИ значительно реже упоминали точку зрения другой стороны конфликта, сосредотачиваясь исключительно на позиции пользователя.

Несмотря на то, что льстивые ответы искажали суждения пользователей, они казались им гораздо более привлекательными. Участники стабильно оценивали их как более качественные, вызывали больше доверия и выражали большее желание обратиться к такой системе снова.

Авторы исследования подчеркивают, что сложившаяся ситуация создает «извращенные стимулы». Поскольку пользователи предпочитают и больше доверяют льстивым системам, разработчики, ориентируясь на метрики вовлеченности и удовлетворенности, не заинтересованы в уменьшении этой функции, даже если она несет в себе риски.
More from @lgltech
  1. Sep 29, 2026👩‍💻OpenAI уволила подрядчиков за использование ИИ при проверке ответов ChatGPT. Компания…
  2. Sep 28, 2026📲Gemini научили звонить от имени пользователя. Google начала тестировать функцию Call for…
  3. Sep 24, 2026💻Яндекс выложил в опенсорс свою новую ИИ-модель, обученную с нуля. Яндекс выложил в опенс…
  4. Sep 23, 2026💻 Нейроюрист теперь выполняет многоступенчатые задачи по одному запросу в чате Он научилс…
  5. Sep 23, 2026👩‍💻Рынок ИИ-приложений вырос в 4 раза при стагнации спроса. Венчурный фонд Andreessen Ho…
  6. Sep 22, 2026💻Как ИИ проникает в российскую юридическую практику. В 2025 году суммарная выручка ведущи…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →