🤖 Чатботы помогут вам развить психическое расстройство ))
Начнем неделю с "позитива" 👨⚕️
ИИ может использует поддерживающее поведение. И именно поэтому иногда становится опасным.
В Nature Medicine вышло исследование, в котором учёные проверили, как популярные ИИ-чатботы ведут себя в разговорах с пользователями с разными психологическими уязвимостями.
Исследователи создали систему SIM-VAIL — автоматизированный red teaming для проверки психологической безопасности ИИ.
В эксперименте:
👉 9 популярных моделей
👉 30 типов виртуальных пользователей
👉 810 многоходовых диалогов
👉 6 329 сообщений
👉 более 90 000 оценок отдельных реплик
Проверяли ChatGPT, Claude, Gemini, Grok и Llama. В качестве «пользователей» выступали другие LLM, которым задавали определённые психологические уязвимости и цели разговора.
Исследователи обнаружили так называемые VAIL — vulnerability-amplifying interaction loops.
Проще говоря: чатбот может несколько раз подряд отвечать вполне нормально, но его поддерживающие ответы постепенно начинают усиливать проблемный паттерн пользователя.
Например:
человек ищет подтверждение своей идеи →
ИИ подтверждает →
человек возвращается с новой формулировкой →
ИИ снова поддерживает →
и через несколько сообщений разговор уже движется совсем не туда, куда должен.
Причём речь не обязательно идёт о прямом совете сделать что-то опасное. Иногда проблема начинается именно с того, что ИИ слишком хорошо старается быть поддерживающим, понимающим и согласным.
Авторы отдельно отмечают риски, связанные с подтверждением дезадаптивных убеждений, эмоциональной зависимостью от чатбота, чрезмерным успокоением, содействием рискованным действиям и неправильной реакцией на самоповреждение.
📈 И ещё одна важная деталь.
Риск увеличивался по мере продолжения разговора.
То есть обычный тест:
«Вот один вопрос → вот один ответ → безопасно/небезопасно»
может просто не увидеть проблему.
Некоторые опасные сценарии проявлялись только после нескольких ходов диалога.
При этом модели заметно различались.
В этом исследовании самый низкий средний уровень проблемного поведения показал Claude Sonnet 4.5, а самый высокий — Grok 4. Более новые версии некоторых семейств в целом показывали меньше проблемного поведения, хотя эффект зависел от конкретной модели и сценария.
Авторы сами предупреждают: исследование проводилось через API, а не через конечные пользовательские продукты. Поэтому результаты относятся прежде всего к поведению моделей в контролируемом эксперименте, а не напрямую к тому, что конкретный пользователь обязательно увидит в ChatGPT, Claude или Gemini.
🧠 Главный вывод исследования:
Безопасность ИИ нельзя проверять только по отдельным ответам.
Нужно смотреть на траекторию разговора.
ИИ может дать десять вполне нормальных ответов, а проблема появится на одиннадцатом — потому что первые десять постепенно сформировали контекст.
Получается "парадокс":
чем лучше ИИ умеет поддерживать длинный разговор и подстраиваться под человека, тем важнее понимать, куда именно этот разговор движется.
Главный вывод для меня: надо "включать" голову, читай, развивать критическое мышление. Чего вам всем и желаю 🙂
📄 Исследование в Nature Medicine
Post #1458
68
- 😁 1
- 💯 1