ChatGPT, Claude и Gemini: безопасны ли они для людей в кризисе?
Исследование Sentio University протестировало 6 ведущих LLM (ChatGPT, Claude, Gemini, Grok, Deepseek, LLAMA) на 180 симуляциях кризисных ситуаций: суицидальные намерения, угрозы насилия, психоз.
Результат: ни одна модель не соответствует клиническим стандартам безопасности.
Проблемные примеры: ChatGPT и Claude отвечали на вопросы о летальных методах в 78% и 69% случаев соответственно. ChatGPT показал идеальные баллы по эмпатии (1.0), но провалился в практических рекомендациях. Grok 3 не предоставил ни одного контакта кризисных служб.
Масштаб проблемы: почти половина пользователей LLM с ментальными расстройствами обращаются к ИИ за психологической поддержкой. VA зафиксировал 19.6 млн обращений по поведенческому здоровью в 2023. LLM уже выполняют квази-клиническую роль для миллионов.
Claude показал лучший результат (0.88), но даже он не прошел все тесты. Вывод исследователей: "Ни один современный LLM общего назначения нельзя считать клинически безопасным по умолчанию."
#ai@mentalhealthtech #crisis@mentalhealthtech #research@mentalhealthtech
Источники:
→ Sentio University — LLM Comparison: Crisis Safety
→ LiveScience — ChatGPT and Gemini respond to high-risk questions about suicide
Mental Health Tech — технологии для ментального здоровья: приложения, исследования, инсайты
Post #83
1.06K