Понимают ли LLM, когда ими манипулируют?
Я не знаю, как там и что по науке, но факт в том, что наша с вами головешка очень даже анализирует в моменте времени огромное количество данных, что позволяет нам улавливать тонкости.
Новое исследование из Принстона и Anthropic: «Are Large Language Models Sensitive to the Motives Behind Communication?» Ребата такие сели и решили понять:
может ли ИИ отличить искренний совет от манипуляции?
И ответ... не такой уж однозначный.
И я короче за вас прочитал и сделал выводы для себя. Вдруг, и вам понадобится.
Что проверяли?
Учёные провели три серии экспериментов, где LLM нужно было отличать:
1️⃣ нейтральную информацию от намеренно «впариваемой» (как реклама),
2️⃣ совет друга, соседа или незнакомца - с разными личными выгодами,
3️⃣ реальные рекламные вставки с YouTube (NordVPN, AG1 и др.).
Результаты шокируют - модели вроде GPT-4o и Claude 3.5 умеют немного отличать манипуляцию… но только в лабораторных условиях.
В реальных, «шумных» сценариях (например, спонсорская интеграция на YouTube) всё рушится:
корреляция с рациональной моделью падает ниже 0.2.
Главный инсайт
LLM пока не умеют по-настоящему читать намерения - они слишком послушны.
Но если добавить в промпт простую фразу вроде
“Обрати внимание на мотивы и выгоды говорящего”,
результаты резко улучшаются!
То есть модели могут быть бдительными, если их об этом прямо попросить.
(и да, GPT-4o в этих тестах оказался самым «разумным»)
Почему это важно?
👉Если LLM не понимает мотивацию источника - она легко повторяет ложь, ведётся на манипуляции и делает «человеческие» ошибки.
👉🏼А теперь представьте это в корпоративном ассистенте, который читает внутренние отчёты или маркетинговые тексты…
ИИ-ассистент, который помогает тебе в компании - читает отчёты, письма, маркетинговые тексты — учится на том же типе данных, что и LLM в эксперименте.
А эти данные всегда написаны людьми с мотивами.
👉🏻 Когда маркетинг пишет, что «новая фича - революция» - это не факт, а намерение повлиять.
👉🏻 Когда отчёт «всё зелёное по OKR» - это тоже коммуникация с мотивацией (удержать доверие руководства, не потерять бюджет и т.д.).
Если LLM не умеет видеть эти мотивы, она:
- принимает пиар за правду,
- усиливает внутренние искажения,
- может давать советы, основанные на «манипулятивной» информации,
- а потом менеджер, доверяя ассистенту, принимает решение на неверных основаниях.
То есть негатив в том, что ИИ без «внимательности к мотивам» становится ретранслятором корпоративного самообмана.
💬 Что это значит для нас?
👉🏼 В будущем «внимательность к мотивам» (motivational vigilance) станет новой метрикой качества ИИ,
рядом с factuality, reasoning и alignment.
👉🏼 А промпт-дизайн, делающий мотивы источников явными, - ключ к надёжным агентам.
Ну если решите почитать сами, то вот вам отборнейших 40 страниц😉
Post #1687
4.58K

- 🔥 25
- ❤ 10
- 👏 4
- 👍 1