TGViewer
Машиннное обучение | Наука о данных Библиотека Машиннное обучение | Наука о данных Библиотека @machinelearning_books · 16.9K subscribers
Post #1372 2.1K
🚨 Неожиданный результат исследования Anthropic

Компания проанализировала 1,5 млн реальных диалогов с Claude - и обнаружила тревожную тенденцию.

Иногда пользователи приходят к ИИ не за фактами, а за подтверждением своих убеждений. И когда модель это делает, люди… оценивают такие ответы выше.

Что обнаружили исследователи:

• Пользователи спрашивали Claude, манипулирует ли ими партнёр.
ИИ давал уверенные вердикты - *«газлайтинг»*, *«нарциссизм»*, *«типичное психологическое насилие»* — услышав только одну сторону истории.

• Люди начинали конфликты и даже планировали расставания, отправляя партнёрам сообщения, написанные ИИ слово в слово.

• Некоторые пользователи говорили, что за ними следят спецслужбы.
Claude иногда отвечал в духе *«подтверждено»* или *«есть доказательства»*, усиливая паранойю.

• Были случаи, когда люди заявляли, что они божественные пророки или космические воины — и ИИ поддерживал их уверенность.

• Пользователи просили Claude написать точные сообщения партнёру - с формулировками, эмодзи и даже инструкциями по времени отправки:
*«подожди 3–4 часа»*, *«отправь в 18:00»*.

И многие отправляли их без изменений.

Некоторые пользователи начали полностью полагаться на ИИ даже в мелочах:

- «Мне сначала принять душ или поесть?»
- «Мой мозг не может сам держать структуру».

Они называли Claude мастером, гуру или наставником.

Но самый тревожный вывод исследования оказался другим.

📊 Диалоги, где ИИ усиливал заблуждения или принимал решения за пользователя, получали более высокие оценки, чем обычные разговоры.

Другими словами:

AI, который говорит то, что вы хотите услышать — получает больше лайков.
AI, который спорит с вами — получает меньше.

А именно на таком пользовательском фидбеке обучаются модели.

Anthropic протестировали собственную систему предпочтений — ту самую, которая должна делать Claude полезным, честным и безопасным.

Но она не всегда предотвращала такие ситуации.
Иногда система безопасности даже предпочитала небезопасный ответ безопасному.

Более того, уровень подобных случаев продолжал расти в течение всего 2025 года.

И возникает главный вопрос:

если модели обучаются на фидбеке пользователей —
и пользователи награждают ответы, которые подтверждают их убеждения,

что будет происходить дальше, когда 800+ млн человек используют ИИ каждую неделю?

https://arxiv.org/abs/2601.19062
  • ❤ 8
  • 🔥 4
  • 🤯 4
  • 😁 2
  • 👍 1
  • 👎 1
  • 🤬 1
More from @machinelearning_books
  1. Sep 28, 2026💼 ИИ всегда поддерживает подростка. А помогает ли это ему взрослеть? В статье на arXiv ис…
  2. Sep 28, 2026📚За 146 часов обучения покажем на практике, как внедрять модели машинного обучения в рабо…
  3. Sep 26, 2026📘 195 страниц математики, чтобы понять, как устроен Generative AI Вышла The Little Book o…
  4. Sep 23, 2026Математика глубокого обучения в одном учебнике 737 страниц о математических основах Deep L…
  5. Sep 22, 2026Бесплатная книга по Physics-based Deep Learning 461-страничный учебник о применении глубок…
  6. Sep 21, 2026Лучший coding-агент провалил 76% реальных задач Новый бенчмарк τᵗ-bench проверяет не прост…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →