Взаимодействия пептидов с белками лежат в основе многих биологических процессов, а дизайн пептидов вызывает всё больший интерес благодаря их терапевтическому потенциалу. Это привело к появлению различных структурных баз данных, одной из которых является PepBDB, в которой на настоящий момент содержится около 13 489 структур.
Группа испанских учёных задалась вопросом, можно ли на этой базе учить модели или извлекать принципы связывания? Оказалось, что нельзя, потому что что в этой базе свалено в кучу совершенно разные вещи: настоящие пептиды, которые в свободном состоянии не имеют структуры, а сворачиваются только при связывании с белком; мини-белки, у которых есть своя структура; фрагменты разрезанных белков (например, серпины — белки, которые «разрезаются» и остаются связанными); пептид-пептидные комплексы; пептиды с внутренними дисульфидными связями; структуры с неприродными аминокислотами; многое другое. И если всё это скормить модели машинного обучения, она выучит не принципы связывания пептидов, а артефакты базы.
Что же сделали благородные доны? Они провели многоступенчатую фильтрацию. Сначала оставили только структуры с небольшим разрешением, убрав 4462 структуры. Затем убрали пептиды с неполными цепями, остатки с отсутствующими атомами, структуры с неприродными аминокислотами и комплексы с нуклеиновыми кислотами. После этого разделили оставшиеся 7216 структур на категории: пептид-пептидные комплексы; мини-белки со своей структурой; пептиды с внутримолекулярными дисульфидными связями; пептиды с межмолекулярными дисульфидами и т.д.. Затем убрали иммуноглобулины, кальмодулин, потому что их слишком много, и они искажают статистику. Посчитали энергию связывания и убрали структуры с экстремальными значениями — это оказались разрезанные фрагменты белков, которые не являются настоящими пептид-белковыми комплексами. В итоге из 13 489 структур осталось 4133.
Что же они обнаружили на оставшейся базе данных? Это самая интересная часть. Они проанализировали энергетику связывания: какие остатки пептида вносят наибольший вклад в связывание. Они определили "горячие точки" как остатки, замена которых на аланин даёт значительное ухудшение в связывании. И обнаружили, что ароматические и объёмные гидрофобные остатки (Trp, Phe, Tyr, Leu, Ile, Met) часто встречаются в "горячих точках" (какая неожиданность, да), полярные и малые остатки (Ser, Thr) встречаются крайне редко, а заряженные остатки (His, Lys, Asp, Glu) занимают промежуточную позицию, кроме аргинина. Т.е., связывание пептида определяется небольшим числом ключевых остатков — «якорей» (гидрофобных и ароматичных аминокислотных остатков).
Расположение горячих точек зависит от длины. В коротких пептидах (5–7 остатков) горячие точки расположены в центре. В длинных пептидах горячие точки расположены по всей длине пептида, с несколькими пиками. Первый участок от N-конца лежит на расстоянии 3–4 остатка, на таком же расстоянии от C-конца лежит другой участок. Расстояние между участками составляет два остатка. Это не случайность. Вторичная структура, дисульфидные связи, размер пептида также определяют тип стабилизации. Так, короткие пептиды почти не агрегируют, а длинные пептиды более склонны к образованию комплексов, и это нужно учитывать при разработке.
Сама работа – пример того, как надо делать: учить модель извлекать физические принципы, а не просто «паттерны».
Кроме того, работа показывает, что существующие базы данных по пептидам и белкам пока не могут быть использованы для машинного обучения без предварительного отсева лишних данных. Плохие данные порождают плохие модели.
Post #1875
94