Biohub открыл ESM-стек для белков: ESMFold2 предсказывает белковые комплексы и проектирует связывающие белки против онко- и иммунных мишеней за дни
В релизе от 27 мая Biohub выложил ESMC, ESMFold2 и ESM Atlas в открытый доступ. В препринте команда описывает атлас на 6,8 млрд белковых последовательностей и 1,1 млрд предсказанных структур, а также лабораторную проверку спроектированных белков против EGFR, PD-L1, CTLA-4, CD45 и PDGFR beta. Это ранний слой поиска: компьютер выбирает молекулы, лаборатория проверяет, цепляются ли они к нужной мишени.
Белки в биологии работают как детали живой машины: одни передают сигнал, другие режут ДНК, третьи сидят на поверхности клетки. Поэтому значительная часть разработки лекарств начинается с простой задачи: найти молекулу, которая точно связывается с нужным белком и не липнет ко всему подряд.
Biohub теперь предлагает делать этот первый поиск через открытый AI-стек. ESMC обучали на примерно 2,8 млрд белковых последовательностей. Модель видит последовательность аминокислот, часть букв скрыта, и она учится угадывать, какие аминокислоты эволюция обычно оставляет в таком контексте. Это похоже на языковую модель, только вместо слов у неё белковые последовательности, а вместо грамматики текста она выучивает ограничения формы, стабильности и функции белка.
На этих представлениях построен ESMFold2. Он предсказывает форму одного белка и комплексы: как два белка ложатся друг на друга и где образуется контакт. В тестах Biohub пишет, что ESMFold2 на ряде задач обгоняет AlphaFold3 и Protenix-v1, а версию ESMFold2-Fast можно гонять массово: структура на 1024 остатка считалась за 9,4 секунды на одном H100.
Лабораторная часть проверяет, выходит ли модель за пределы бенчмарков. Команда взяла пять мишеней из онкологии и иммунологии: EGFR, PDGFR beta, PD-L1, CTLA-4 и CD45. EGFR и PDGFR beta связаны с ростом опухолей, PD-L1 и CTLA-4 помогают раку глушить Т-клетки, CD45 регулирует сигналы иммунных клеток.
Для этих мишеней ESMFold2 спроектировал два типа связывающих белков. Minibinder здесь значит маленький новый белок, придуманный под мишень. scFv значит single-chain antibody fragment, фрагмент антитела в виде одной цепочки. Затем Biohub проверил, насколько молекулы держатся за мишени.
Когда команда тратила больше вычислений, доля попаданий составила 36-88% для minibinders и 15-29% для scFv. В среднем больше вычислений подняло долю попаданий у minibinders с 53,8% до 70,0%, а у scFv с 12,1% до 21,0%. Авторы показывают, что больший цифровой перебор даёт больше молекул, которые проходят первый лабораторный фильтр.
Дальше Biohub проверил несколько сильных вариантов подробнее. Для EGFR-minibinder команда получила cryo-EM структуру комплекса с разрешением 3,8 ангстрема и увидела близкое совпадение с предсказанной позой. Для PD-L1 один minibinder и один scFv восстановили сигналинг Т-клеток в клеточном тесте: они блокировали ту же ось PD-1/PD-L1, на которой работает atezolizumab.
До лекарства здесь несколько стадий. Препринт ждёт рецензии, а связывание в пробирке и клеточный тест оставляют открытыми вопросы доставки, токсичности и поведения в организме. Хороший hit rate на пяти известных мишенях сохраняет главный барьер: биологическую проблему сначала нужно правильно превратить в мишень.
В апреле Biohub объявил Virtual Biology Initiative на $500 млн: данные, измерения, модели клетки. Сейчас рядом с этой ставкой появился рабочий белковый слой: открытые модели, API, атлас и пример, где компьютерный поиск доходит до физической проверки.
Такая инфраструктура сокращает расстояние между идеей мишени и первой пачкой молекул, которые можно реально положить на лабораторную пластину. Если это работает за пределами витринных задач, узкое место сдвигается дальше: к выбору правильных мишеней, проверке в живых системах и способности отличить красивую связывающую молекулу от терапии, которая меняет ход болезни.
Post #1639
195
Forwarded from УХВАТ
Telegraph Biohub открыл ESM-стек для белков: ESMFold2 предсказывает белковые комплексы и проектирует связывающие белки против онко- и иммунных… Biohub 27 мая выложил открытую систему для работы с белками: языковую модель ESMC, структурную модель ESMFold2 и ESM Atlas, где можно искать по 6,8 млрд белковых последовательностей и 1,1 млрд предсказанных структур. В препринте команда описала не только…- ❤ 1