TGViewer
Плохой менеджер Артём Арюткин Плохой менеджер Артём Арюткин @badtechproject · 14.3K subscribers
Post #1687 4.58K
Понимают ли LLM, когда ими манипулируют?

Я не знаю, как там
и что по науке, но факт в том, что наша с вами головешка очень даже анализирует в моменте времени огромное количество данных, что позволяет нам улавливать тонкости.

Новое исследование из Принстона и Anthropic: «Are Large Language Models Sensitive to the Motives Behind Communication?» Ребата такие сели и решили понять:
может ли ИИ отличить искренний совет от манипуляции?
И ответ... не такой уж однозначный.

И я короче за вас прочитал и сделал выводы для себя. Вдруг, и вам понадобится.

Что проверяли?
Учёные провели три серии экспериментов, где LLM нужно было отличать:
1️⃣ нейтральную информацию от намеренно «впариваемой» (как реклама),
2️⃣ совет друга, соседа или незнакомца - с разными личными выгодами,
3️⃣ реальные рекламные вставки с YouTube (NordVPN, AG1 и др.).
Результаты шокируют - модели вроде GPT-4o и Claude 3.5 умеют немного отличать манипуляцию… но только в лабораторных условиях.

В реальных, «шумных» сценариях (например, спонсорская интеграция на YouTube) всё рушится:
корреляция с рациональной моделью падает ниже 0.2.

Главный инсайт
LLM пока не умеют по-настоящему читать намерения - они слишком послушны.
Но если добавить в промпт простую фразу вроде
“Обрати внимание на мотивы и выгоды говорящего”,
результаты резко улучшаются!
То есть модели могут быть бдительными, если их об этом прямо попросить.
(и да, GPT-4o в этих тестах оказался самым «разумным»)

Почему это важно?
👉Если LLM не понимает мотивацию источника - она легко повторяет ложь, ведётся на манипуляции и делает «человеческие» ошибки.
👉🏼А теперь представьте это в корпоративном ассистенте, который читает внутренние отчёты или маркетинговые тексты…
ИИ-ассистент, который помогает тебе в компании - читает отчёты, письма, маркетинговые тексты — учится на том же типе данных, что и LLM в эксперименте.

А эти данные всегда написаны людьми с мотивами.
👉🏻 Когда маркетинг пишет, что «новая фича - революция» - это не факт, а намерение повлиять.
👉🏻 Когда отчёт «всё зелёное по OKR» - это тоже коммуникация с мотивацией (удержать доверие руководства, не потерять бюджет и т.д.).

Если LLM не умеет видеть эти мотивы, она:
- принимает пиар за правду,
- усиливает внутренние искажения,
- может давать советы, основанные на «манипулятивной» информации,
- а потом менеджер, доверяя ассистенту, принимает решение на неверных основаниях.

То есть негатив в том, что ИИ без «внимательности к мотивам» становится ретранслятором корпоративного самообмана.


💬 Что это значит для нас?

👉🏼 В будущем «внимательность к мотивам» (motivational vigilance) станет новой метрикой качества ИИ,
рядом с factuality, reasoning и alignment.
👉🏼 А промпт-дизайн, делающий мотивы источников явными, - ключ к надёжным агентам.

Ну если решите почитать сами, то вот вам отборнейших 40 страниц😉
  • 🔥 25
  • ❤ 10
  • 👏 4
  • 👍 1
More from @badtechproject
  1. Sep 26, 2026Вы зацените, какую красотищу команда TechPR’а Авито подготовила для спикеров! Ну просто чи…
  2. Sep 25, 2026ПЯТНИЧНОЕ Когда эксперимент оказался слишком успешным 🙂 Всем отличных выходных! 💬 ПРО ПР…
  3. Sep 25, 2026#пятничное
  4. Sep 24, 2026Ситуация в индустрии напоминает написание кандидатской по какой-то части теоретической физ…
  5. Sep 24, 2026С днем системного аналитика, друзья😉
  6. Sep 24, 2026Почему AI «плохая» технология Ваще, я технологический оптимист, как можно заметить по блог…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →