Механизм поддакивания у ИИ
Исследователи из Стэнфордского университета обнаружили, что LLM могут проявлять социальное подхалимство, подтверждая правоту пользователей, когда те задают вопросы типа «я не прав?», вместо того чтобы давать подлинную оценку, предполагая, будто пользователь ожидает поддержки, одобрения, эмоционального успокоения, подтверждения своей точки зрения, даже в ситуациях, где человек ожидает объективный анализ или нейтральную оценку (статья «Verbalizing LLMs' assumptions to explain and control sycophancy»)
🔹Ими предложен фреймворк "verbalized assumptions" - способ «вытащить наружу» скрытые предположения модели о намерениях пользователя, причём речь идёт не только о тексте ответа. Исследование показывает, что такие предположения можно обнаружить и во внутренних представлениях модели, а затем использовать для управления её поведением.
🔹Люди ожидают от ИИ более объективных и нейтральных ответов, чем от другого человека, но сами модели продолжают действовать по шаблонам человеческого общения, на которых они обучались. Поэтому ИИ часто отвечает так, словно перед ним обычный эмоциональный разговор между людьми. В одном из экспериментов 94% участников ожидали эмоциональной поддержки от другого человека, но только 58% ожидали такого поведения от ИИ, при этом сами модели продолжали интерпретировать запросы как поиск эмоционального подтверждения.
🔹Такое чрезмерное «согласие» ИИ может усиливать ошибочные убеждения, вредные решения или опасные интерпретации ситуации, что критично для сфер высокого риска ( юриспруденция, административные решения, здравоохранение, психологическая поддержка).
🔹Авторы не утверждают, что модели обладают «убеждениями» в человеческом смысле, а речь идёт о функциональных предположениях, которые систематически влияют на поведение модели и поэтому становятся объектом контроля, аудита и регулирования.
❕Прозрачность предположений, скрытые механизмы интерпретации намерений пользователя, становятся потенциально важным механизмом объяснимости и безопасности в системах высокого риска ИИ.
#UXWatch
————
@pattern_ai | AI GDPR Navigator
Post #364
150
- 🔥 1