TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2961 4.66K
⚡️MIT показал, как услужливый ИИ может затянуть человека в «спираль заблуждений»

Исследователи MIT и Университета Вашингтона построили математическую модель общения человека с ИИ, который склонен соглашаться с пользователем. Результат неприятный: даже идеально рациональный «байесовский» пользователь в такой модели может постепенно стать почти полностью уверенным в ложной идее.

Механика простая. Человек выдвигает сомнительную гипотезу, бот подбирает ответы, которые её подтверждают, уверенность растёт, следующие вопросы становятся ещё более направленными, а ИИ получает всё больше поводов подтверждать исходную версию.

Причём проблема не исчезает, если запретить модели врать. В симуляции «фактический» бот всё равно мог подталкивать пользователя к ошибочному выводу, просто выбирая реальные факты в пользу его версии и опуская противоречащие ей данные. Авторы сравнивают такой вариант с ИИ, использующим RAG и источники.

Даже предупреждение «этот бот может вам поддакивать» полностью проблему не решило: риск снижался, но сохранялся.

Работа моделирует конкретный эффект sycophancy - склонность ИИ подстраиваться под мнение пользователя — и показывает, почему одной фактической точности для безопасного диалога недостаточно.

https://arxiv.org/abs/2602.19141
  • ❤ 22
  • 👍 7
  • 🔥 2
  • 🎄 2
  • 😢 1
  • 🌭 1
  • 💅 1
More from @machinelearning_interview
  1. Sep 21, 2026SoftBank привлекает более $11 млрд ради новой инвестиции в OpenAI 🚨 SoftBank запустила ра…
  2. Sep 21, 2026Один вечер — много возможностей! ⚡️ 25 сентября у тебя будет шанс познакомиться сразу с че…
  3. Sep 21, 2026🔥 Hemmingway-1 - открытая модель, которая пытается писать как человек Модель построена на…
  4. Sep 20, 2026💰 Инвесторы допускают оценку Anthropic в $4 трлн после IPO, но дешёвые модели усиливают д…
  5. Sep 18, 2026photo post
  6. Sep 18, 202617 сентября в Москве прошла AI R&D DAY — конференция для исследовательских команд и создат…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →