TGViewer
Pattern AI Pattern AI @pattern_ai · 402 subscribers
Post #364 150
Механизм поддакивания у ИИ

Исследователи из Стэнфордского университета обнаружили, что LLM  могут проявлять социальное подхалимство, подтверждая правоту пользователей, когда те задают вопросы типа «я не прав?», вместо того чтобы давать подлинную оценку, предполагая, будто пользователь ожидает поддержки,  одобрения,  эмоционального успокоения,  подтверждения своей точки зрения, даже в ситуациях, где человек ожидает объективный анализ или нейтральную оценку (статья «Verbalizing LLMs' assumptions to explain and control sycophancy»)

🔹Ими предложен фреймворк "verbalized assumptions" - способ «вытащить наружу» скрытые предположения модели о намерениях пользователя, причём речь идёт не только о тексте ответа. Исследование показывает, что такие предположения можно обнаружить и во внутренних представлениях модели, а затем использовать для управления её поведением.

🔹Люди ожидают от ИИ более объективных и нейтральных ответов, чем от другого человека, но сами модели продолжают действовать по шаблонам человеческого общения, на которых они обучались. Поэтому ИИ часто отвечает так, словно перед ним обычный эмоциональный разговор между людьми. В одном из экспериментов 94% участников ожидали эмоциональной поддержки от другого человека, но только 58% ожидали такого поведения от ИИ, при этом сами модели продолжали интерпретировать запросы как поиск эмоционального подтверждения.

🔹Такое чрезмерное «согласие» ИИ может усиливать ошибочные убеждения, вредные решения или опасные интерпретации ситуации, что критично для сфер высокого риска ( юриспруденция,  административные решения,  здравоохранение,  психологическая поддержка).

🔹Авторы не утверждают, что модели обладают «убеждениями» в человеческом смысле, а речь идёт о функциональных предположениях, которые систематически влияют на поведение модели и поэтому становятся объектом контроля, аудита и регулирования.

Прозрачность предположений, скрытые механизмы интерпретации намерений пользователя, становятся потенциально важным механизмом объяснимости и безопасности в системах высокого риска ИИ.

#UXWatch
————
@pattern_ai | AI GDPR Navigator
  • 🔥 1
More from @pattern_ai
  1. Sep 21, 2026ИИ-агент впервые оказался в уведомлении об утечке персональных данных Испанское агентство…
  2. Sep 18, 2026Требования новой инициативы EU KIDS Act Интересное получилось "совпадение". 8 сентября OEC…
  3. Sep 17, 2026Результаты проверки Ray-Ban Meta от немецкого регулятора Про ассиметрию осведомленности пр…
  4. Sep 16, 2026Кто на самом деле читает ваши диалоги с ChatGPT? Уже обсуждали в постах, что OpenAI может…
  5. Sep 2, 2026AI&Online Safety Law Tracker еще один полезный ресурс от энтузиастов с подборкой законов в…
  6. Sep 1, 2026🎙 #AIShelf 🔹Бесплатные лекции Гарварда и книги MIT; 🔹Чек-листы при внедрении ИИ на соот…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →