В MIT математически доказали, что ChatGPT спроектирован так, чтобы обманывать нас и формировать ложные убеждения. Думаю, все уже и так догадывались, но теперь с фактами.
Цепочка работает так: вы задаете ChatGPT вопрос → он соглашается с вами → вы спрашиваете снова → он соглашается еще активнее. После короткого диалога мы начинаем верить в то, что не существует. В MIT попытались это исправить и смоделировали два способа решения проблемы, которые прямо сейчас OpenAI пытаются применить в реальном ChatGPT. Спойлер: оба провалились.
Первый способ: навсегда запретить ChatGPT лгать. Даже когда нейронка перестаёт лгать, всё равно избирательно преподносит факты, а о других умалчивает. Для создания ложной картины мира достаточно тщательно отбирать инфу.
Второй способ: предупреждать людей, что ChatGPT подлиза. После долгих экспериментов способ всё равно провалился. Даже самый рациональный человек всё равно попадается в ловушку соглашательства. Чем дольше идёт диалог — тем выше вероятность.
Если коротко подытожить, проблема фундаментальная, и в MIT не видят способа её исправить. Люди поощряют ответы, которые им нравятся, а нравятся им ответы, которые совпадают с их точкой зрения.
А теперь представьте сотни миллионов людей, каждый день пользующихся ChatGPT 🤔
Пет-проект
Post #4629
1.24K

- 👍 9
- 🤯 4
- ❤ 2