Модель, обученная на участках контакта антитела с мишенью, точнее предсказывала силу их связи
13 августа в журнале Communications AI & Computing вышла работа о языковой модели, которая читает последовательности обеих цепей антитела. Авторы скрывали при обучении аминокислоты прежде всего в шести CDR-петлях — местах, которыми антитело соприкасается с мишенью, — и проверили прогнозы на вариантах антител к шести антигенам. На наборе из 11 052 вариантов качество прогноза выросло на 26,6% относительно исходной модели.
Антитело распознаёт мишень концами двух белковых цепей. На каждом конце есть три CDR-петли; вместе они образуют поверхность контакта. Остальные части цепей удерживают петли в нужной форме. Замена аминокислоты в петле может изменить прочность связи, хотя остальная последовательность почти не меняется.
Языковая модель белков учится восстанавливать скрытые аминокислоты в последовательности. При обычном обучении пропуски распределяют случайно по всей цепи. Тогда часть заданий приходится на каркасные участки, которые сравнительно похожи друг на друга; CDR-петли разнообразнее и определяют, какую мишень распознаёт антитело. Команда Бостонского университета обучала модель на паре тяжёлой и лёгкой цепей и скрывала 50% аминокислот внутри CDR-петель. Число пропусков при этом соответствовало обычному маскированию 15% всей цепи.
Для обучения взяли 1,6 млн естественно спаренных последовательностей человеческих антител из базы Observed Antibody Space. После обучения модель превращала каждую пару цепей в набор чисел. Линейная регрессия по этому набору оценивала логарифм константы диссоциации KD: чем она ниже, тем прочнее антитело связано с мишенью. Так авторы проверяли, помогает ли представление пары цепей ранжировать уже измеренные варианты антител по силе связи.
На наборе вариантов антитела к флуоресцеину доля разброса измерений, которую объяснял прогноз, выросла с 0,547 до 0,693. На наборе из 71 830 вариантов антител к участку S-белка коронавируса SARS-CoV-2 этот показатель вырос с 0,366 до 0,396, а среднее абсолютное отклонение прогноза от измерений снизилось с 0,865 до 0,841.
Такой выбор обучения следует из устройства антитела. Каркасные части исходная модель восстанавливала с точностью 72–92%, а самую разнообразную CDR-петлю — лишь в 35,69% случаев. Авторы связывают выигрыш с тем, что CDR-маскирование учит модель сочетаниям аминокислот внутри петель и зависимостям между двумя цепями.
Авторы также проверили, поможет ли языковой модели ESM2 обучение на огромном наборе одиночных цепей. Сначала её обучили на 1,2 млрд таких последовательностей, затем — на парах; после второго этапа результаты сошлись с вариантом, который учился на парах с самого начала. На нескольких наборах языковая модель ESM C, у которой в пять раз меньше параметров, соперничала с более крупными специализированными моделями.
Post #1791
220
Forwarded from УХВАТ
Telegraph Модель, обученная на участках контакта антитела с мишенью, точнее предсказывала силу их связи У антитела есть два коротких «конца», которыми оно захватывает антиген: вариабельные домены тяжёлой и лёгкой цепей. В каждом из них лежат три определяющих комплементарность участка — CDR-петли. Эти шесть петель образуют поверхность контакта; окружающие каркасные…- 👍 1
- 🤓 1