TGViewer
Femtech Force — новости, вакансии, подкаст Femtech Force — новости, вакансии, подкаст @femtechforce · 7.55K subscribers
Post #3768 497
👁 Бенчмарк OpenAI для ментального здоровья: почему живые психологи в нём проиграли моделям

Привет! Меня зовут Ольга Титова, я AI Product Manager, выступаю за безопасный и этичный подход к ИИ, и регулярно делюсь с подписчиками Femtech Force новостями из мира ИИ и здоровья.

Сегодня разберём новый бенчмарк оценки моделей от OpenAI для ментального здоровья, и попробуем посмотреть на него чуть шире, чем пресс-релиз.

🔶 Что это такое?

23 сентября OpenAI представила MentalHealthBench. Это открытый набор из 1 215 диалогов, по которому оценивают, как языковые модели отвечают людям в разговорах о ментальном здоровье. Главное отличие от предыдущих бенчмарков в том, что он покрывает не только кризисы вроде суицидальных мыслей или психоза. В нём есть и повседневные ситуации: отношения, стресс, выгорание, забота о близком, и такие разговоры составляют чуть больше половины набора. Критерии оценки составляли 80+ лицензированных психиатров и психологов из 22 стран. 

💥 Что показали результаты?

Лучший результат у GPT-6 Astra (57,3%). За ней идут GPT-6 Sol (53,9%) и Claude Opus 5.5 (52,4%). У Gemini 3.1 Pro и GPT-4o по 32,1%. Даже лучшая модель набирает чуть больше половины возможных баллов. Слабее всего у моделей получается уточнять контекст и правильно оценивать срочность ситуации.

💥 На что стоит обратить внимание?

Разработчик моделей оценивает сам себя. Ответы всех моделей, включая конкурентов, проверяет GPT-5.6 Sol, модель самой OpenAI, а первые два места заняли модели OpenAI. 
Диалоги синтетические. Их сгенерировали LLM-симуляторы пользователей на основе обезличенных паттернов из ChatGPT.
 
Клиницисты проиграли моделям. Ответы, которые написали сами эксперты, набрали 38,5%, ниже большинства моделей. Авторы объясняют это стилем: психологи отвечают коротко, как в живом разговоре, часто одним вопросом. Длинные ответы моделей просто успевают закрыть больше пунктов рубрики. Получается, что высокий балл измеряет покрытие чек-листа, а не доказанную пользу для человека.

Пользователи хотят другого. OpenAI отдельно попросила 44 человек, которые используют ИИ для эмоциональной поддержки, написать собственные критерии. С экспертными они совпали лишь на 25,7%. Пользователи больше ценят практические шаги и тон, эксперты — осторожность и сбор контекста.

➡️ Что я думаю?

Мне кажется, несмтря на аффилиацию с OpenAI, работа получилась достаточно прозрачной: данные открыты, промпт грейдера опубликован, а раздел об ограничениях написан честно. Сам сдвиг фокуса с «не навредить в кризисе» на более спокойные разговоры тоже давно назрел: по опросу APA, 77% психологов говорят, что их пациенты упоминают использование ИИ.

При этом важно: бенчмарк хорошо измеряет, совпадает ли ответ с представлением экспертов о хорошем ответе, но стало ли человеку лучше. Это скорее инструмент для разработчиков, чем рейтинг «какому ИИ доверить свои переживания», и авторы, к их чести, сами так и пишут. Независимая проверка, в идеале на живых людях и с оценщиком не от разработчика, ещё впереди.

@FemtechForce — о технологиях для здоровья женщин

Текст подготовила #ОльгаТитова
  • ❤ 9
  • 👍 1
  • 🔥 1
More from @femtechforce
  1. Oct 1, 2026Ищем героинь для статьи о менопаузе Привет! На связи Саша — контент-лид Femtech Force. Сов…
  2. Sep 29, 2026Что лучше всего помогает женщинам спать? Вы ждали этот метаанализ Привет, друзья! Сегодня…
  3. Sep 25, 2026Дайджест фемтех-вакансий за неделю 💥Marketplaces Lead — Whoop Компания, создающая wearabl…
  4. Sep 25, 2026Наша исследовательница Алина Акбашева выступит на Vibe & Code Команда Femtech Force очень…
  5. Sep 25, 2026Post #3764
  6. Sep 24, 2026ЭТИ ДНИ в Белграде: «Ну и кто я теперь? Профессиональная реализация женщин в эмиграции» Пр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →