8 июня Anthropic опубликовала Science Blog к препринту о VirBench, проверке научных агентов на задачах из вирусной геномики. Авторы просили Claude, GPT, Biomni и Edison Analysis достать из NCBI Virus наборы последовательностей по заданным фильтрам. После добавления инструмента gget virus точность всех агентов поднялась как минимум до 90%.
NCBI Virus — это публичный портал с вирусными последовательностями из GenBank, RefSeq и международных баз ДНК. Вирусологи используют такие данные, когда следят за вспышками, проверяют диагностические тесты и собирают обучающие наборы для моделей белков.
Задача выглядит простой: найти все последовательности вируса Эбола у людей из Африки, собранные в нужный период, достаточной длины и без лишних неопределённых букв в геноме. Для человека это несколько фильтров в веб-интерфейсе. Для агента это цепочка программных запросов, страниц выдачи, сверки идентификаторов и локальной фильтрации.
В разборе Anthropic один и тот же запрос к Claude Sonnet 4 дал три разных ответа: 106, 15 и 5 последовательностей при ручной проверке в 266. Bo Wang пересказал эту сцену жёстче:
Anthropic дала передовым моделям одну задачу: достать вирусные последовательности из NCBI. Один и тот же запрос, три запуска. Claude Sonnet 4 вернул 106, 15, затем 5 последовательностей. Ручной ответ: 266.
Ошибка здесь начинается до «мышления о биологии». Агент может понять формулировку запроса, но потерять часть выдачи на страницах результатов, применить фильтр к неправильному полю или смешать записи, где страна лежит в названии вируса вместо отдельной колонки. Получается набор данных, который выглядит научно, но уже испорчен. Ричард Саттон описывал ту же операцию на уровне метода: генератор даёт варианты, а научной машине нужен внешний способ проверить и отобрать правильный результат.
Авторы показали это на дереве вируса Эбола. Ручной набор последовательностей дал корень вспышки, то есть оценку общего предка образцов, около января 2014-го, как в прежних работах. Один из наборов, собранных Sonnet 4, сдвинул оценку к 1922 году. Другой выглядел правдоподобно, но пропустил последовательности из Гвинеи и перенёс корень к апрелю 2014-го.
Тот же сбой менял картину по антительным препаратам maftivimab и MBP134. Если агент пропускает часть вирусных геномов, исследователь видит другой набор мутаций в участках, куда должны садиться антитела. В таком месте ошибка извлечения данных превращается в биологический вывод.
Для проверки авторы сделали VirBench: 120 запросов по 40 патогенам, каждый с ручным ответом. У агентов были веб-поиск и выполнение кода: они могли искать документацию, ставить пакеты и вызывать сервисы NCBI. Без специального слоя доступа средняя точность шла от 16,9% у Claude Sonnet 4 до 91,3% у GPT-5.5. С gget virus, инструментом для повторяемых запросов к NCBI Virus, все системы поднялись до 90% и выше, а GPT-5.5 дошёл до 99,7%.
gget virus делает скучную работу: выбирает нужный маршрут между сервисами NCBI, забирает лёгкие метаданные до скачивания последовательностей, разбивает большие выдачи на партии, повторяет запросы при сбоях и пишет лог, по которому можно восстановить путь к ответу. В одном примере с SARS-CoV-2 за 2025 год обычный подход «скачай всё и отфильтруй» тянул 284 ГБ данных; gget virus оставил 3,83 ГБ.
Ограничение остаётся: такой инструмент чинит маршрут к данным; качество самих записей остаётся на стороне базы. Если в базе неверная страна, неполная дата или криво названный белок, агент получит повторяемый набор с ошибкой источника. С таким слоем научный агент начинает работу с проверяемого запроса. Браузерный квест, где каждый клик может тихо изменить результат, уходит в код и логи.