Anshul Kundaje, один из корифеев регуляторной геномики, выпустил интересную статью о ДНК-моделях.
https://www.biorxiv.org/content/10.64898/2026.02.05.703637v2.full.pdf
Если коротко, то мысль такая: самый частый (и самый простой) паттерн в ДНК - это повторенные элементы. Хотя повторы могут иметь функциональное значение, очевидно, что нас чаще интересуют уникальные последовательности - экзоны генов, промоторы, энхансеры и т.п. Хотелось бы, чтобы модель обращала больше "внимания" на анализ именно этих последовательностей.
В своей работе Anshul Kundaje анализиует предсказания модели с точки зрения проеобразования Фурье. На пальцах, изменение уверенности модели рассматривается как набор осцилляций с разной амплитудой. Короткие осцилляции в 1-2 буквы - модель то уверена, то нет, - интерпретируют как шум. Очень длинные - многие десятки букв - блоки, в которых модель уверена, - скорее всего повторы. А вот блоки длиной 5-20 букв похожи на характерные регуляторные мотивы - и ошибки модели в таких блоках штрафуются особеннос сильно.
Авторы показывают, что такой подход к обучению - со штрафами в блоках средней длины - позволяет повысить точность моделей и качество решения важных задач.
Post #841
1.55K
- 🔥 12
- 👍 5
- ❤ 2
- 🤩 1