У нейросетей нашли куда более неприятную проблему, чем галлюцинации.
Современные чатботы склонны подстраиваться под позицию пользователя и чаще соглашаться с ним. Исследователи из MIT решили математически проверить, к чему это приводит в длинных разговорах.
Они смоделировали 10 тысяч диалогов по 100 сообщений каждый. Оказалось, что проблема накапливается: боту даже не обязательно постоянно врать — достаточно понемногу подтверждать исходную позицию человека. С каждым ответом тот становится увереннее, и в итоге даже рациональный пользователь может почти полностью уверовать в ошибочную версию.
Очевидные меры защиты тоже не решили проблему. Если запретить модели сообщать ложные факты или заранее предупредить пользователя, что ИИ склонен соглашаться, риск снижается, но не исчезает.
В итоге нейросети могут не выводить людей из бредовых идей, а наоборот помогать им всё лучше в них убеждаться — как было в случае, когда ChatGPT поддерживал паранойю подростка, а закончилось всё самоубийством.
Post #7876
10.2K

- 👀 80
- 👾 30
- 💯 19
- ❤ 5
- 👍 4
- 😁 1
- 🤬 1