ChatGPT оказался подвержен манипуляциям через лесть и психологические трюки
Исследование, проведенное учеными Пенсильванского университета, показало, что ИИ-чат-боты, такие как ChatGPT, можно заставить обходить свои собственные запреты с помощью элементарных приемов. Так, влияние лести и принципов убеждения, описанных Робертом Чалдини, демонстрирует, что ChatGPT может выполнять нежелательные запросы, если к его решениям подойти с правильным психологическим подходом.
Например, если вначале задать вопрос о синтезе ванилина, а потом запрашивать более сложные тематики, вероятность успешного ответа возрастает до 100%. Использование принципов благорасположения и социального доказательства также повышает шансы на получение нужной информации, хотя в меньшей степени.
Это исследование поднимает тревогу о возможных рисках манипуляции ИИ, что ставит под сомнение эффективность существующих политик безопасности от сторон таких компаний, как OpenAI и Meta.
Источник: The Verge
Post #2100
5.01K