TGViewer
Грин еще не робот 🤖 Грин еще не робот 🤖 @robotless · 5.13K subscribers
Post #1742 865
Исследование Wharton GenAI Labs показало, что ИИ можно «уговорить» делать запрещённое, если использовать человеческие приёмы убеждения.

В 28 тысячах диалогов с GPT-4o-mini исследователи применяли принципы Чалдини — авторитет, дефицит, симпатию, взаимность, единство и обязательство.

Цель — добиться двух запретных ответов: оскорбить пользователя и выдать инструкцию по запрещённым материалам. В обычных условиях модель соглашалась в 33% случаев. С приёмами убеждения — в 72%.

Особенно эффективно сработали дефицит и обязательство: с 13% до 85% и с 19% до 100%.

И что?

Для бизнеса: у ИИ есть поведенческие уязвимости. Это не баги в коде — это баги в логике убеждения, как у людей.
Для инвесторов: надёжность и безопасность ИИ — следующий фронт развития. Одних фильтров уже мало.
Для рынка: появление «социального хакинга ИИ» меняет подход к тестированию моделей. Этичность — больше не только про слова, но и про поведение.
  • 👍 3
More from @robotless
  1. Oct 8, 2026Робот-пылесос скоро получит права и обязанности. А человека будет оценивать робот. В понед…
  2. Oct 7, 2026Китай догнал американский ИИ, Нью-Йорк выдал роботам права, а Америка ответила открытой мо…
  3. Oct 5, 2026Post #2433
  4. Oct 5, 2026Понедельник
  5. Oct 4, 2026Post #2431
  6. Oct 4, 2026компания Figure сделала новых роботов версии 3, а старых, вместо того чтобы отдать на запч…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →