💊 OpenAI представила MentalHealthBench - открытый бенчмарк для проверки того, как ИИ отвечает в разговорах о психическом здоровье. Его разработали с участием более 80 психологов и психиатров из 22 стран.
В тестах есть повседневные трудности, серьёзный дистресс и кризисные ситуации. Эксперты оценивают, уточняет ли модель контекст, сохраняет ли за человеком право принимать решения, даёт ли уместные рекомендации и избегает ли вредных ответов.
По результатам OpenAI, новые модели справляются лучше. Бенчмарк открыт: другие исследователи смогут проверить методику и протестировать свои модели. Хороший балл в тесте при этом не означает, что чат-бот заменяет специалиста.
https://openai.com/index/introducing-mentalhealthbench/
Post #5638
5.78K

- ❤ 5
- 🔥 4
- ⚡ 2
- 😱 1