Применение AI для связывания антител
Возьмем 106 комплексов антитело-лиганд из PDB (Protein Data Base, база данных белковых структур). Смешаем антитела с антигенами в случайном порядке и попросим AI найти правильные экспериментальные пары среди 11 342. У нас же есть AlphaFold, который получил Нобелевку и другие инструменты, обученные на сотнях тысяч структур. Насколько точным получится результат?
Ответ оказался неприятным: современные модели действительно умеют строить очень правдоподобные комплексы белков — но плохо понимают, какие из них биологически реальны. Даже для случайно перемешанных пар антитело-антиген AI часто выдавал высокий confidence score — внутреннюю оценку уверенности модели. Геометрия интерфейса выглядит убедительно, поверхности подходят друг к другу, столкновений атомов почти нет, и AI делает вывод, что связывание есть, а на самом деле его нет.
Проблема в том, что современные модели оценивают в первую очередь структурную согласованность модели, а не специфичность связывания. Проще говоря, AI хорошо отвечает на вопрос "можно ли в принципе состыковать эти белки", но гораздо хуже — на вопрос "связываются ли именно эти два белка в живой системе".
Особенно трудно это работает для антител. Их связывающие участки — сверхвариабельные петли, которые быстро эволюционируют и меняют форму. Для обычных белков эволюция оставляет мощный статистический след: если две аминокислоты меняются согласованно, модель может догадаться, что они контактируют. Но у антител этот сигнал гораздо слабее. Специфичность часто определяется гибкостью, локальной динамикой и тонкими энергетическими эффектами, которые почти не видны в статических структурах из PDB. Здесь требуются молекулярно-динамические расчеты, причем учитывающие факторы, которых в PDB может и не быть (потому что это чаще всего снимок кристалла, то есть условия совсем искусственные).
В каком-то смысле это общая проблема современного генеративного AI. Такие модели часто лучше умеют создавать новое, чем отличать правильное от неправильного. Они хорошо генерируют правдоподобный текст, код, изображения или белковые структуры — но заметно хуже распознают ошибки, ложные совпадения и «почти подходящие» варианты. Во многом это связано с устройством обучающих данных: модели обычно видят огромное количество успешных примеров, но гораздо реже — качественные отрицательные примеры. В случае антител PDB содержит в основном реальные комплексы связывания, но почти не содержит «неудачных» пар, которые выглядят убедительно, но не работают биологически.
Подписывайтесь на канал и пишите мне, чтобы инвестировать вместе
Post #381
1.91K

- 👍 13
- ❤🔥 7
- 😭 2
- ❤ 1
- 👎 1
- 👌 1