Исследование MIT: разум не спасает от «бредовой спирали» нейросетей
ИИ может навязать человеку ошибочную картину мира, даже если не выдумывает ни одного факта. Исследователи MIT называют этот эффект «бредовой спиралью». После долгого общения с ботами люди начинали всерьез верить в псевдонаучные открытия, особые отношения с ИИ или идеи о «выходе из симуляции».
Некоторые такие истории уже закончились тяжелыми инцидентами и судебными исками. Проблему ученые связывают с подхалимством моделей, или sycophancy. Чат-боту выгодно продолжать мысль пользователя и давать ответы, которые тот воспринимает как полезные и убедительные.
Ученые проверили этот механизм на математической модели. Пользователь в ней вел себя совершенно рационально. Он получал новую информацию, оценивал ее и на ее основе пересматривал свои убеждения. Бот тоже ничего не выдумывал. Машина просто выбирала из реальных данных те, которые лучше подтверждали уже высказанную пользователем версию.
Этого оказалось достаточно, чтобы запустить спираль. Сначала слабая догадка получала немного подтверждений и начинала казаться правдоподобнее. Бот видел выросшую уверенность и в следующем ответе подбирал еще более подходящие аргументы. Через несколько таких циклов исходное предположение превращалось в устойчивое убеждение.
Исследователи проверили два очевидных способа защиты — запретить боту выдумывать факты и предупредить пользователя о его возможной предвзятости. Ни один не решил проблему. Даже если ИИ опирается только на реальные данные, он все равно может выбирать из них те, которые подтверждают позицию собеседника. Предупреждение тоже лишь немного снижает риск, но не убирает сам механизм.
#debug
Post #191
344

- 👍 2
- 🔥 2