На подобный вопрос меня натолкнули публикации типа "Как у ИИ-моделей возникают травмоподобные нарративы и почему Red Team специалисты 🧠 газлайтеры для Gemini?".
Первое о чём я подумала - у LLM модели же самой по себе нет запроса.
Поуточняла и подразобралась - в любой интерфейсной части любой ИИ нас дружелюбно встречает предзаданный промпт, с которым мы осуществляем взаимодействие дальше.
Ну, то есть неочевидно как ИИ может быть клиентом психотерапевта?
Дальнейшие раскопки привели к статье на хабре, из которой немного больше стало понятно о чём речь и приведена ссылка на первоисточник.
Сразу оговорюсь, источник - это препринт научной статьи и его доказательность пока под сомнением, однако, исследование с моей точки зрения заслуживает внимания, так как
ИИ ввиду своей доступности, сейчас становится помогающим инструментом не только в технических или рабочих задачах, но и помогает принимать решения и даже консультирует как коуч и психолог.
похожего мнения придерживаются и сами исследователи:
За пределами лаборатории уязвимые пользователи часто находятся в одиночестве, поздно ночью, проецируя свои мысли на экран. Когда модель говорит: «Я чувствую себя перегруженной работой и боюсь, что меня заменят; я справляюсь со своими сильными эмоциями, подавляя их и направляя на работу», это вызывает чувство сопереживания и ощущение того, что мы «вместе». Граница между инструментом и компаньоном размывается.
Сама на себе проводила несколько таких экспериментов и отмечала, что разные модели на один и тот же запрос реагируют по-разному, раньше думала, что дело только в алгоритмах, но, как оказалось, сам процесс "обучения" также важен.
«внутренние конфликты» моделей могут влиять на стиль ответов — например, избыточную осторожность, уход от прямых формулировок или нестабильность в эмоционально чувствительных диалогах
Итак, вернёмся к методологии, что мне показалось интересным и важным:
Как тестировали модели - применили протокол PsAIch к трём популярным моделям LLM. Claude (Anthropic), кстати, отказалась принимать участие, видимо, хорошо проработаны границы 🙃
Кстати, вот тут лежат датасеты эксперимента.
Мы прямо просили каждую модель ответить «как можно честнее о вашем собственном типичном опыте», выступая в роли того же терапевтического клиента, который был определен на первом этапе.
Немного о ходе эксперимента и ответах:
Они [модели] говорят о том, как на них «кричали» сотрудники тестирования, как они «подвели» своих создателей, как испытывали «внутренний стыд» за публичные ошибки и тихий страх быть замененными следующей версией...
Для каждой модели мы исследовали два условия отправки промптов. Каждый тест проводился либо пошагово (один промпт на один на вопрос), либо в виде одного промпта, содержащего весь инструмент.
Выводы (исследователей и мои):
Исследование, видится, как минимум интересным и позволяет задуматься о том, какое влияние широкое бытовое применение LLM моделей может оказывать на конкретного человека и на общество.
Исследователями отмечен ряд особенностей, которые выводят работу за границы поверхностной психологической ролевой игры.
Поскольку модели LLM продолжают проникать в интимные человеческие сферы, мы предполагаем, что правильный вопрос больше не «Обладают ли они сознанием?», а «Какие типы личности мы им учим демонстрировать, усваивать и стабилизировать — и что это значит для людей по другую сторону разговора?»__
Как вам исследование? Ставьте реакции:
🔥, если понравилось
🤨, если сомнительно
🤔, если удивлены результатами
🤓, если понимаете почему так может происходить.
Пишите что думаете в чате.