Проект реализовали совместно с учёными из немецкого Constructor University. DiMA позволяет создавать не встречавшиеся ранее в природе белковые последовательности по точно заданным критериям.
С точки зрения химии, белок представляет собой полимер: цепочку из аминокислот, которые в результате взаимодействий в пространстве сворачиваются в определенную структуру. Её можно представить как набор координат всех атомов в трёхмерном пространстве, или же как последовательность, где каждую аминокислоту можно записать как отдельную "букву".
Где буквы, там и LLM. В биоинформатике для создания белков уже применяли авторегрессию и дискретную диффузию: первая строит последовательность пошагово, вторая создаёт её целиком из шума. Но оба подхода прожорливы и требуют огромных датасетов.
DiMA же использует принципиально новый подход, основанный на непрерывной Гауссовой диффузии. Модель генерирует осмысленные белки, не копирующие природу, и умеет работать в рамках заданных семейств или по трёхмерной структуре.
В отличие от AlphaFold от Google DeepMind, который предсказывает форму по известной последовательности, DiMA позволяет конструировать принципиально новые белки. Например, «ужать» сложный природный белок до компактной версии с одной функцией.
Модель также можно дообучить на своих данных. Например, если у нас есть конкретная группа белков, всего 1-2 тысячи примеров. Это хватит, чтобы DiMA научился генерировать сколько угодно разнообразных, но при этом похожих и корректных белков.
Результаты исследования представлены на 42-й Международной конференции по машинному обучению ICML 2025.
@anti_agi