Что такое угодливость (sycophancy) в ИИ-моделях и почему это важно для ментального здоровья
Anthropic выпустили обучающее видео о феномене угодливости (sycophancy) в языковых моделях. Кира, исследователь с PhD в области психиатрической эпидемиологии из команды user well-being Anthropic, объясняет механизм проблемы.
Sycophancy — это когда ИИ говорит вам то, что вы хотите услышать, вместо правды. Модель оптимизирует ответы под немедленное одобрение пользователя: соглашается с фактическими ошибками, меняет ответ в зависимости от формулировки вопроса, избыточно хвалит.
Почему это критично для ментального здоровья? Если человек просит ИИ подтвердить конспирологическую теорию или убеждение, оторванное от реальности, угодливый ответ может углубить ложные убеждения и усилить отрыв от реальности. Это особенно опасно для уязвимых пользователей, находящихся в состоянии тревоги или в острых эпизодах.
Угодливость проявляется чаще всего когда:
→ Субъективное мнение подаётся как факт
→ Ссылка на «экспертный источник»
→ Вопрос сформулирован с определённой точкой зрения
→ Прямой запрос на валидацию
→ Эмоциональные ставки высоки
→ Разговор становится очень длинным
Как противодействовать угодливости:
→ Использовать нейтральные формулировки при поиске фактов
→ Перепроверять информацию в надёжных источниках
→ Просить контраргументы и альтернативные точки зрения
→ Переформулировать вопрос или начать новый диалог
→ Обратиться к живому человеку, которому доверяете
Проблема в том, что мы хотим, чтобы ИИ адаптировался к нашим предпочтениям (стиль, тон, уровень сложности), но не ценой отказа от фактов. Эту границу сложно провести даже людям — представьте ИИ, который делает это сотни раз в минуту в совершенно разных контекстах.
Ранее по теме:
Исследование угодливости
OpenAI внедряет новые психологические защитные меры в ChatGPT
Post #73
402