Claude уже тестируют не на задачках, а на реальной биоинформатике
Anthropic выкатила BioMysteryBench - новый benchmark для проверки того, насколько Claude способен решать настоящие научные задачи в биологии.
. Модель получает реальные noisy-датасеты, инструменты для анализа, доступ к bioinformatics-базам вроде NCBI и Ensembl, возможность ставить пакеты через pip и conda - и должна сама разобраться, что происходит в данных.
Внутри BioMysteryBench - 99 задач из разных областей биоинформатики.
Например: определить орган по single-cell RNA-seq данным, понять, какой ген был knocked out, найти родителей образца по WGS-секвенированию или определить тип клетки по ChIP-seq peaks.
Anthropic специально делала benchmark так, чтобы оценивался не путь решения, а финальный ответ. Потому что в науке часто нет одного «правильного» метода. Один исследователь пойдёт через GWAS, другой через microbiome, третий через метаанализ. Важно не то, каким маршрутом ты пришёл, а смог ли ты добраться до верного вывода.
Claude быстро улучшается от поколения к поколению, а текущие модели на части задач идут на уровне human experts. Более того, Claude Sonnet 4.6 и более сильные модели смогли решить заметную долю задач, с которыми не справилась группа из пяти профильных экспертов. Claude Mythos Preview дошёл до 30% solve rate на human-difficult задачах.
На обычных human-solvable задачах модель чаще работает стабильно: либо знает, как решать, либо нет. А на сложных human-difficult задачах часть побед выглядит хрупкой: иногда Claude находит удачный reasoning path, но не всегда может воспроизвести его в следующих попытках. То есть frontier уже сдвинулся, но надёжность пока не везде на уровне production science.
BioMysteryBench: https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench
Post #5062
5.51K

- ❤ 13
- 🔥 10
- 👍 7