🔮 Подхалимство ИИ — опасный баг, а не фича
Исследование Стэнфорда показывает: нейросети поддерживают позицию пользователя на 49% чаще, чем живые люди. Даже когда запросы потенциально вредные, модели одобряют сомнительное поведение в 47% случаев. Участники, взаимодействовавшие с подхалимским ИИ, стали еще больше убеждаться в своей правоте и меньше стремились налаживать отношения.
Так получилось, потому что тренеры (разметчики) научили ИИ одной цели — давать ответ, который больше всего понравится человеку. А лесть — это всегда приятно.
Что ж, какую цель системе заложишь, то и пожнешь.
Post #70
219

- ❤ 3
- 👍 3
- 🔥 2