TGViewer
Заметки LLM-энтузиаста Заметки LLM-энтузиаста @llm_notes · 1.01K subscribers
Post #159 255
OpenAI представила HealthBench: новый стандарт для оценки медицинских AI-систем 🩺🤖

OpenAI выпустила HealthBench — новый бенчмарк, созданный совместно с 262 врачами для оценки эффективности AI-систем в медицинских беседах. Похоже, теперь у нас есть "официальный термометр" для измерения температуры искусственного интеллекта в медицине.

Что нужно знать 📋

• Бенчмарк тестирует модели по различным темам (скорая медицинская помощь, глобальное здравоохранение и т.д.) и поведенческим характеристикам (точность, качество коммуникации).

• Новые модели показывают значительно лучшие результаты — o3 от OpenAI набрала 60%, в то время как GPT-3.5 Turbo всего 16%. Прогресс налицо, хотя до идеала еще далеко.

• Интересно, что даже маленькие модели стали гораздо способнее — GPT-4.1 Nano превосходит старые варианты, при этом обходясь в 25 раз дешевле. Вот такой интересный прогресс в экономии на здоровье :)

• OpenAI сделала открытым исходный код как самих оценок, так и тестового набора данных, включающего 5000 реалистичных многоэтапных медицинских диалогов между моделями и пользователями.

Почему это важно 🤔

Существует множество примеров того, как ИИ может серьезно улучшить работу в медицинской сфере. Наличие проверенных врачами бенчмарков — важный шаг для измерения производительности каждой модели в медицинском контексте.

Конечно, одно дело — хорошо отвечать на тесты, и совсем другое — не навредить реальным пациентам. Но, по крайней мере, теперь у нас есть "линейка", которой можно измерить, насколько наш цифровой доктор готов к приему.

#ИИвМедицине #OpenAI #HealthBench #ИскусственныйИнтеллект #ЦифровоеЗдравоохранение
  • ❤ 3
  • 👍 1
More from @llm_notes
  1. Sep 12, 2026Cronjob Response: Мониторинг анонсов reset от лидера Codex (job_id: 7a5e133998e4) --------…
  2. Sep 12, 2026Для всех активных пользователей Codex - Важная информация ниже - Недельные лимиты Codex сб…
  3. Aug 25, 2026Копируем «единорогов» на Claude Code: 8 недель — 8 прототипов. Старт завтра Завтра, 26 авг…
  4. Aug 25, 2026Grok Bot против Hermes Agent: два подхода к одной задаче Коллеги, добрый вечер! Скорее все…
  5. Jul 27, 2026Claude Opus 5: почти Fable за половину цены Коллеги, всем привет! 24 июля Anthropic выпуст…
  6. Jul 1, 2026🔓🚀 Возвращение Fable 5 и появление Sonnet 5 Anthropic за сутки закрыла историю с приоста…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →