OpenAI предложила новый бенчмарк для оценки моделей в медицине - HealthBench
Оценили корректность ответов моделей по 7 направлениям. Далее ответы моделей оценивали врачи. В конце посчитали уровень согласия с ответами моделей. Вообщем если кратко, то по многим направлениям модели уже отвечают так, что врачи согласны с их мнением. Стран откуда были медики довольно много. Получается ждем новых интеграций и внедрений.
P.S. Это не рекомендация не ходить к врачам а просто комментарий новости. Помните что модели склонны ошибаться, перепроверяйте ответы!
https://openai.com/index/healthbench/
Post #718
398