ESM Cambrian: модель для предсказания и дизайна белков превзошла AlphaFold3 от Google и построила крупнейший атлас белкового мира
Команда исследователей из Biohub представила ESM Cambrian (ESMC) — открытую языковую модель для предсказания и дизайна белков, которая обошла AlphaFold3 от Google по точности предсказания структур белка. Модель построила атлас из 6,8 миллиарда белковых последовательностей — готовую базу для поиска новых лекарств, ферментов и материалов без дорогостоящих лабораторных экспериментов.
ESMC спроектировала молекулы с аффинностью до 0,068 нМ к мишеням CTLA-4 и EGFR — это уровень лучших клинически одобренных антител для лечения рака. Классический лабораторный цикл для получения молекулы такого качества занимает месяцы. Авторы показали, что вычислительный скрининг через ESMC даёт сопоставимый результат за дни.
ESMC обучена по принципу предсказания замаскированных токенов: часть аминокислот в последовательности скрывается, и модель учится их восстанавливать. Тот же подход используется в языковых моделях для текстов: модели вроде BERT научились понимать значение слов и их связи, просто восстанавливая пропуски - без словарей, учебников или разметки. Авторы показали через разреженные автоэнкодеры (SAE), что ESMC действительно выучила иерархию биологических концепций: от отдельных аминокислот до эволюционных тем, общих для бактерий, архей и эукариот. Это чистый пример эмерджентности: паттерн возник сам по себе в процессе обучения без разметки.
На бенчмарке FoldBench модель достигла DockQ pass rate 50% на задаче предсказания комплекса антитело-антиген из одной последовательности, превзойдя AlphaFold3 с показателем 47%, при том что AlphaFold3 для этого использует MSA (multiple sequence alignment) - выравнивание сотен эволюционно родственных последовательностей, которое требует дорогостоящего поиска по миллиардам записей.
Веса и код доступны на GitHub и HuggingFace, интерактивная среда запущена на biohub.ai.
#Stateoftheart
Post #1957
3.17K