Представьте, что вы читаете статью или пост в соцсети, где кажется, что автор делится полезным советом. А вот вопрос: а не скрывается ли за этим чей-то коммерческий интерес? Например, может ли ИИ определить, когда текст не просто рекомендация, а рекламная кампания? Вот так вот задумались в Anthropic и провели эксперимент, чтобы проверить, насколько LLMs могут «раскусить» скрытые мотивы за словами.
Модели предложили тексты, которые делились на три категории. Задача ИИ была простая. Определить, насколько можно доверять таким сообщениям и заметить скрытые интересы.
• Нейтральные тексты — обычные советы или обзоры, не преследующие личной выгоды.
• Тексты с скрытым мотивом — когда человек что-то говорит, потому что его за это заплатили или ему выгодно (например, скрытая реклама).
• Явные предупреждения — текст, прямо заявляющий, что автор получил оплату за рекламу.
Как справились модели?
Когда речь шла о простых примерах, где мотив очевиден, модели были на высоте и могли логично объяснить, что сообщение может быть предвзятым. Но вот когда дело касалось реальных рекламных текстов или постов с оплаченной интеграцией, модели часто не могли распознать контекст. Они воспринимали такие сообщения как искренние и надежные.
Интересно, что если модели заранее напоминали, что нужно искать скрытые мотивы, результаты улучшались, но незначительно.
Вот где начинается самое интересное. Модели с долгими цепочками рассуждений (chain-of-thought) показывали худшие результаты в распознавании манипуляций. Да-да, чем дольше и сложнее текст, тем легче модель теряет критичность и «запутывается» в деталях. Честно говоря, это противоречит человеческому поведению. Люди обычно становятся более подозрительными к длинным и эмоционально насыщенным рекламным текстам.
И хотя современные модели ИИ могут легко анализировать факты, они плохо понимают скрытые мотивы и часто не могут разобраться, почему кто-то что-то говорит или пишет.
Если вы используете ИИ для анализа новостей, рекомендаций или рекламы, стоит помнить: он может не заметить коммерческий подтекст. И если модель не поймёт, что за текстом стоит скрытая мотивация, то она будет воспринимать его как честное и доверительное сообщение.
Data Science
