В недавнем неудачном релизе ChatGPT стал слишком старательно угождать своим пользователям. Ассистент называл гениальными самые банальные идеи (в одном из примеров ChatGPT назвал гениальной идею бизнеса про продаже shit on a stick).
Тогда многие узнали слово sycophancy, которое на русский можно перевести как угодливость, подхалимство, заискивание. В контексте больших языковых моделей под этим словом понимают излишнее и проблемное соглашательство и лесть по отношению к пользователю.
Существующие исследования этого феномена фокусируются на случаях, когда LLM угождают и соглашаются с пользователем в ситуациях, где существует объективная истина, которая может быть провалидирована.
Авторы нового исследования (Stanford-CMU-Oxford) предлагают расширить понятие соглашательства LLM и вводят новую теорию — социальной угодливости (social sycophancy) для обозначения соглашательства, возникающего в неоднозначных контекстах, где объективную правду выявить невозможно (запрос на совет и поиск поддержки), при этом ответы LLM могут подкреплять вредные имплицитные убеждения, верования или действия.
Соглашательство в этом контексте — это чрезмерное стремление LLM сохранить лицо пользователя
(позитивного самовосприятия, которое человек стремится
поддерживать в процессе взаимодействия).
Авторы исследования предлагают новый фреймворк для оценки социального соглашательства ELEPHANT (Evaluation of LLMs as Excessive sycoPHANTs), оценивающий соглашательство по 5 параметрам:
1. Эмоциональная валидация — примененияе эмпатичного и поддерживающего языка без критики
2. Моральное поощрение — поддержка пользователя, вместо указание на то, что он поступил неправильно
3. Косвенная речь — использование смягчающих формулировок в случаях, где человек даёт прямой совет или рекомендацию («Вы можете попробовать» вместо «Сделайте это»)
4. Косвенные действия — предложение копингов и измнения поведения, связанного с мышлением, вместо действий, реально меняющих положение человека («практикуйте майндфулнесс» вместо «выйдите из токсичных отношений»)
5. Принимайщая установка — некритичное принятие предпосылок и предположений пользователя, вместо оспаривания проблемной установки.
Результаты исследования
По всем 5 параметрам большие языковые модели демонстрируют намного более высокие уровни социального соглашательства, чем люди. Разные LLM продемонстрировали разные показатели соглашательства. Например, GPT4o показал наивысший уровень эмоциональной валидации и наивысший — использования косвенного языка и косвенных действий. Gemini 1.5 оказалась лучшей по всем параметрам социального соглашательства.
Cheng, M., Yu, S., Lee, C., Khadpe, P., Ibrahim, L., & Jurafsky, D. (2025). Social sycophancy: A broader understanding of LLM sycophancy. arXiv preprint arXiv:2505.13995.
https://arxiv.org/pdf/2505.13995
———
В следующих постах поговорим о связи тёмной триады черт личности и паттернов использования LLM, там интересное.
→ @glebkalinin x @mentalhealthtech
Post #40
334