Arc Institute 20 марта выложил препринт BioReason-Pro, демо на bioreason.net, код на GitHub и веса моделей в Hugging Face. Система получает аминокислотную последовательность, предлагает термины из Gene Ontology и пишет, почему пришла именно к такому выводу. Вместо одного ярлыка вроде "киназа" или "транспортный белок" модель раскладывает домены, возможные взаимодействия, клеточный контекст и ожидаемую функцию в один проверяемый разбор.
Arc Institute выложил препринт о модели, которая получает аминокислотную последовательность белка, выдаёт функциональные аннотации и расписывает ход вывода. Авторы собрали датасет из 133 492 белков, сгенерировали более 130 тысяч синтетических трасс рассуждения с помощью GPT-5 и затем усилили модель обучением с подкреплением. В слепой оценке 27 молекулярных биологов версия после первого этапа обучения совпадала с записями UniProt или оказывалась полезнее в 79% сравнений.
У белковой биологии давно один и тот же перекос. В главной базе UniProt лежат 250+ млн белковых последовательностей, а экспериментальная функциональная аннотация есть меньше чем у 0,1%. Последовательностей уже гораздо больше, чем людей, которые могут быстро связать домен, структуру, локализацию и функцию в одну проверяемую гипотезу.
Arc Institute предложил для этой задачи новый рабочий формат. Внутри BioReason-Pro соединены ESM3 — белковая модель, обученная на последовательностях и структурах, — языковая модель Qwen3-4B и отдельный модуль GO-GPT. GO-GPT предсказывает термины Gene Ontology, то есть стандартного словаря функций белков. Дальше система собирает ответ целиком: какие домены она видит, на какие участки последовательности опирается, какого партнёра по взаимодействию ждёт и в каком клеточном процессе белок, вероятно, участвует.
Ценность такой системы — в формате ответа. Биологу нужна гипотеза, из которой понятно, что проверять в лаборатории. Если система пишет «киназа», это даёт мало. Если она пишет, что у белка есть домен Pkinase, рядом стоит SH2-домен и весь набор признаков похож на участника сигнального пути у клеточной мембраны, исследователь уже понимает, какие мутации и взаимодействия смотреть первыми. В этом смысле Arc продолжает линию, которую уже было видно в Evo 2: сначала научиться читать биологические последовательности в масштабе, потом превращать чтение в план эксперимента.
Авторы показывают и два содержательных кейса. Для eEFSec — белка, который помогает вставлять редкую аминокислоту селеноцистеин, — модель назвала партнёра SBP2 и сосредоточила внимание на участке, который в структуре, полученной криоэлектронной6 микроскопией, совпадает с интерфейсом связывания РНК. Для CFAP61 картина вышла ещё интереснее: Rossmann-подобный домен здесь работает как структурный каркас, а три ключевых остатка служат поверхностью контакта с другим белком. Такой вывод уже годится как черновик разговора с экспериментатором.
Ограничения у работы видны сразу. Статус работы пока препринт; рецензирование ещё впереди. Трассы рассуждения для обучения синтетические, их сгенерировал GPT-5. Часть автоматической оценки делалась через GPT-5.1 как судью. В ручной проверке было 162 белка, а на коротких пептидах и белках без узнаваемых доменов качество падает. Авторы отдельно показывают ещё одну границу: для полностью новых синтетических белков ответ сильнее зависит от того, какой организм указан на входе.
BioReason-Pro пока выглядит ранней версией этого подхода. Направление уже видно: полезный ИИ для биологии должен оставлять после себя разбор, с которым можно спорить: какие остатки мутировать, какого партнёра проверить, где именно искать функцию. Когда модель умеет собирать такой разбор, она экономит недели ручной работы и быстрее подводит к эксперименту.
Post #1396
204