TGViewer
Бесконечное ИТ Бесконечное ИТ @neverendingit · 363 subscribers
Post #718 398
OpenAI предложила новый бенчмарк для оценки моделей в медицине - HealthBench

Оценили корректность ответов моделей по 7 направлениям. Далее ответы моделей оценивали врачи. В конце посчитали уровень согласия с ответами моделей. Вообщем если кратко, то по многим направлениям модели уже отвечают так, что врачи согласны с их мнением. Стран откуда были медики довольно много. Получается ждем новых интеграций и внедрений.

P.S. Это не рекомендация не ходить к врачам а просто комментарий новости. Помните что модели склонны ошибаться, перепроверяйте ответы!

https://openai.com/index/healthbench/
OpenAI Introducing HealthBench HealthBench is a new evaluation benchmark for AI in healthcare which evaluates models in realistic scenarios. Built with input from 250+ physicians, it aims to provide a shared standard for model performance and safety in health.
  • 👍 3
More from @neverendingit
  1. Aug 7, 2026История про взлом Hugging Face обросла деталями. Прогрессивное комьюнити разделилось на дв…
  2. Jul 23, 2026"В конечном счёте, и лидерство, и доверие заслуживаются одинаково - постоянством в том, чт…
  3. Jul 22, 2026Потрясающая история произошла недавно в мире AI/Security буквально на наших с вами глазах.…
  4. Jul 1, 2026Как ArchUnit помогает командам Netflix управлять изменениями в коде. Я несколько раз вплот…
  5. Jun 25, 2026Блокировка доступа к моделям Anthropic, OpenAI породила огромный черный рынок в Китае (и в…
  6. Jun 23, 2026Представили новый HTTP метод - QUERY. Призван закрыть пустоту между GET и POST в части раб…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →