TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #10453 19.1K
📌 OpenAI собрала бенчмарк на научное суждение в биологии

GeneBench-Pro - набор тестов, проверяющий, способны ли модели самостоятельно принимать исследовательские решения при работе с биологическими данными. Он оценивает умение проводить сложный анализ данных в генетике и смежных областях биологии и медицины.

Моделям дают неструктурированные, как в реальной лаборатории, данные, краткое описание задачи и целевую величину, которую нужно оценить (но не говорят, как считать).

Чтобы прийти к верному ответу, система должна сама пройти цепочку зависимых решений: очистить данные, выявить артефакты, выбрать подходящий статистический метод и пересмотреть план, если промежуточные результаты противоречат исходной гипотезе.

Для всех 129 задач условия смоделированы так, чтобы проверять ответ однозначно, по принципу "всё или ничего".

Набор охватывает 10 областей и 21 подобласть, а 82 задачи прошли проверку у экспертов-биологов.

Сильнейшая из протестированных моделей, GPT-5.6 Sol, верно решает 28,7% задач на максимальном уровне рассуждений и 31,5% в режиме Pro.

Лучший результат среди моделей других вендоров у Claude Opus 4.8 (16,0%).

OpenAI называет такой результат заметным для настолько трудного теста.


🟡Практическая ценность

По опросу рецензентов, одна задача GeneBench-Pro заняла бы у специалиста порядка 20–40 часов, что при ставке около $200 в час выливается в несколько тысяч долларов.

Расчёт той же задачи моделью стоит значительно меньше, но конкретных цифр OpenAI не дает. Для стандартных моделей в техотчёте приведён средний расход токенов как приблизительная оценка вычислительных затрат (около 33 200 токенов для Sol в максимальном режиме).

🟡Дисклеймер

Обозначение Pro в контексте бенчмарка - это режим работы модели, а не отдельная линейка продуктов или новые тарифы ChatGPT.


@ai_machinelearning_big_data

#news #ai #ml
  • 🤓 96
  • 👍 31
  • 👏 13
  • ❤ 10
  • 🤔 8
  • 🥰 4
  • 🔥 3
More from @ai_machinelearning_big_data
  1. Oct 2, 2026⚡️ Одна и та же модель набирает 62% в одном агентном харнессе и 33% в другом. Hugging Face…
  2. Oct 2, 2026✔️ OpenAI заблокировала атаку дистилляции скрытых CoT своих моделей Компания пресекла камп…
  3. Oct 2, 2026🌟 Cloudflare выпустила открытые модели решений Clef Обе модели, Clef и Clef-flash, вышли…
  4. Oct 2, 2026✔️ ВКонтакте научила Ленту отличать интерес к контенту от намерения купить Инженеры AI VK…
  5. Oct 2, 2026✔️ Anthropic раздаёт бесплатные плюшевые игрушки и стикеры На сайте для разработчиков clau…
  6. Oct 2, 2026🌟 SGLang научил чат-модели отвечать вероятностями Команда открытого движка инференса SGLa…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →