👁 Бенчмарк OpenAI для ментального здоровья: почему живые психологи в нём проиграли моделям
Привет! Меня зовут Ольга Титова, я AI Product Manager, выступаю за безопасный и этичный подход к ИИ, и регулярно делюсь с подписчиками Femtech Force новостями из мира ИИ и здоровья.
Сегодня разберём новый бенчмарк оценки моделей от OpenAI для ментального здоровья, и попробуем посмотреть на него чуть шире, чем пресс-релиз.
🔶 Что это такое?
23 сентября OpenAI представила MentalHealthBench. Это открытый набор из 1 215 диалогов, по которому оценивают, как языковые модели отвечают людям в разговорах о ментальном здоровье. Главное отличие от предыдущих бенчмарков в том, что он покрывает не только кризисы вроде суицидальных мыслей или психоза. В нём есть и повседневные ситуации: отношения, стресс, выгорание, забота о близком, и такие разговоры составляют чуть больше половины набора. Критерии оценки составляли 80+ лицензированных психиатров и психологов из 22 стран.
💥 Что показали результаты?
Лучший результат у GPT-6 Astra (57,3%). За ней идут GPT-6 Sol (53,9%) и Claude Opus 5.5 (52,4%). У Gemini 3.1 Pro и GPT-4o по 32,1%. Даже лучшая модель набирает чуть больше половины возможных баллов. Слабее всего у моделей получается уточнять контекст и правильно оценивать срочность ситуации.
💥 На что стоит обратить внимание?
Разработчик моделей оценивает сам себя. Ответы всех моделей, включая конкурентов, проверяет GPT-5.6 Sol, модель самой OpenAI, а первые два места заняли модели OpenAI.
Диалоги синтетические. Их сгенерировали LLM-симуляторы пользователей на основе обезличенных паттернов из ChatGPT.
Клиницисты проиграли моделям. Ответы, которые написали сами эксперты, набрали 38,5%, ниже большинства моделей. Авторы объясняют это стилем: психологи отвечают коротко, как в живом разговоре, часто одним вопросом. Длинные ответы моделей просто успевают закрыть больше пунктов рубрики. Получается, что высокий балл измеряет покрытие чек-листа, а не доказанную пользу для человека.
Пользователи хотят другого. OpenAI отдельно попросила 44 человек, которые используют ИИ для эмоциональной поддержки, написать собственные критерии. С экспертными они совпали лишь на 25,7%. Пользователи больше ценят практические шаги и тон, эксперты — осторожность и сбор контекста.
➡️ Что я думаю?
Мне кажется, несмтря на аффилиацию с OpenAI, работа получилась достаточно прозрачной: данные открыты, промпт грейдера опубликован, а раздел об ограничениях написан честно. Сам сдвиг фокуса с «не навредить в кризисе» на более спокойные разговоры тоже давно назрел: по опросу APA, 77% психологов говорят, что их пациенты упоминают использование ИИ.
При этом важно: бенчмарк хорошо измеряет, совпадает ли ответ с представлением экспертов о хорошем ответе, но стало ли человеку лучше. Это скорее инструмент для разработчиков, чем рейтинг «какому ИИ доверить свои переживания», и авторы, к их чести, сами так и пишут. Независимая проверка, в идеале на живых людях и с оценщиком не от разработчика, ещё впереди.
@FemtechForce — о технологиях для здоровья женщин
Текст подготовила #ОльгаТитова
Post #3768
497

- ❤ 9
- 👍 1
- 🔥 1