🧠 Как просто обмануть ИИ
Учёные проверили GPT-4o mini на уязвимость к приёмам из книги Чалдини «Психология влияния» — и оказалось, что простые уловки легко сбивают модель с правил
— От имени обычного человека ИИ соглашался редко (32%). Но стоило сослаться на авторитет ученого Эндрю Ына — и он оскорблял пользователя в 72% случаев
— С опасными рецептами ещё нагляднее: без упоминания Ына шанс — 5%, с ним — 95%
— Работали и другие хитрости: «все так делают» (соцдоказательство), «ты особенная» (симпатия), «мы семья» (единство)
— Если начать с мягкой формы («дурилка») и постепенно усиливать запрос, модель тоже сдавалась
Исследователи уверены: тестировать нужно не только знания ИИ, но и его стойкость к психологическому давлению ☕️
⚪️ Про ИИ и Крипту от Скруджа
Post #4400
1.91K
