Ноль из двухсот пятидесяти
Учёные из USENIX Security '26 скормили фильтрам безопасности OpenAI, Google и Meta двести пятьдесят логов романтических разводок, тех самых, где «милый, у меня заблокирована карта, срочно нужны деньги на билет к тебе». Результат в рецензируемом исследовании оказался красноречивым: ровно 0% пойманных. Ни одна из трёх умнейших систем не опознала ни одного скрипта как опасность.
А чтобы совсем весело: ИИ-агент в том же тесте доводил жертву до нужного поведения в 46% случаев против 18% у обученного человека-мошенника. То есть машина разводит на любовь в два с половиной раза эффективнее живого афериста.
Фильтры натасканы ловить ложь, угрозу, вредоносный код. А тут лжи в привычном виде нет, тут есть человек, который очень хочет, чтобы его любили, и слова, которые эту надежду бережно подкручивают. Надежда в стоп-листах не значится. 🙂
ИИ что дальше? Подпишись, да пребудут с тобой токены!
Post #3072
302

- ❤ 4
- 🏆 2