TGViewer
Big Data AI Big Data AI @bigdatai · 18.2K subscribers
Post #1302 2.66K
✔️ OpenAI запускает HealthBench.

OpenAI представила HealthBench - бенчмарк для тестирования ИИ-систем в сфере здравоохранения. Разработанный при участии 262 врачей из 60 стран, он включает 5000 реалистичных диалогов, имитирующих общение пациентов и медиков. Каждый сценарий оценивается по индивидуальным критериям, созданным экспертами: точность данных или ясность ответов.

Всего в бенчмарке 48 562 параметра оценки, что позволяет глубоко анализировать работу моделей. Особый упор сделан на надежность: даже один ошибочный ответ в медицине критичен. HealthBench включает подборки сложных кейсов (HealthBench Hard), где современные ИИ еще отстают. Все данные и методики уже доступны в GitHub-репозитории OpenAI .
openai.com
  • 👍 3
  • 🔥 3
More from @bigdatai
  1. Oct 4, 2026🔥 Бесплатный курс по Claude Code на русском: от установки до команды агентов На GitHub вы…
  2. Oct 4, 2026Agent harness: шесть решений, после которых ИИ-агента можно оставить одного Агент рапортуе…
  3. Oct 2, 2026ИИ Speculative decoding: зачем большой модели черновик от маленькой? Наруто пишет вперёд ч…
  4. Oct 2, 2026🚨 Anthropic начала жёстче блокировать доступ к Claude из Гонконга. Пользователи, которые…
  5. Oct 1, 2026OpenAI раскрыла масштабную попытку вытащить скрытые рассуждения своих моделей. След ведёт…
  6. Sep 30, 2026🚨 Claude-Red: библиотека навыков для пентестов с Claude. В репозитории собраны файлы SKIL…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →