Исследователи MIT представили PottsMPNN — ML-фреймворк для дизайна белков, который пытается уйти от чрезмерной зависимости от природных последовательностей.
Проблема в самой метрике. Долгое время модели для protein design оценивали по тому, насколько хорошо они восстанавливают последовательность, которую выбрала эволюция.
❓ Но если модель создаёт новый белок, с чем его сравнивать? У него может просто не быть природного аналога.
PottsMPNN вместо этого учитывает физические взаимодействия между аминокислотами и моделирует sequence-energy landscape — связь между последовательностью и стабильностью структуры.
Это помогает искать последовательности, которые подходят заданной структуре, даже если они не похожи на известные природные.
И здесь интересный вывод уже не только для биологии:
💡 Если модель должна генерировать новое, метрика не должна наказывать её за непохожесть на существующие примеры.
Сравнивать результат с датасетом удобно. Но удобная метрика не всегда измеряет то, что нам действительно нужно.
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека дата-сайентиста
