TGViewer
Цифровая химия | ИОНХ РАН Цифровая химия | ИОНХ РАН @digichemistry · 325 subscribers
Post #53 1.44K
Неопределённость как инструмент, а не побочный продукт предсказания

Модели с оценкой неопределённости предсказаний существуют давно. Классический пример - регрессия на гауссовских процессах, где неопределённость по сути отражает, насколько новая точка "далека" от уже виденных данных обучающей выборки. Обычно эта неопределённость используется как индикатор доверия к прогнозу - сигнал "здесь модель уверена, а здесь не очень", особенно полезный в протоколах активного обучения. Новый препринт предлагает превратить этот индикатор в рабочий инструмент: использовать его не для последующей оценки, а для активной коррекции самого прогноза молекулярного свойства.

Авторы отталкиваются от подходов оценки неопределённости предсказаний нейросетей - в частности, от эвиденциальных нейросетей (evidential neural networks, дословно — "доказательные", хотя устоявшегося русского термина пока нет). В отличие от байесовских ансамблей, которым для оценки неопределённости нужно несколько прогонов сети, эвиденциальная модель делает это за один проход, предсказывая не просто число, а параметры распределения. Из них она раскладывает общую неопределённость на два вида: алеаторную (неустранимый шум самих измерений) и эпистемическую — неопределённость, связанную именно с недостатком знаний модели, которая в теории уменьшается по мере появления новых релевантных данных.

Именно эпистемическая неопределённость и стала рабочим инструментом в статье. Авторы предлагают метод EviKal: для новой молекулы берётся её эпистемическая неопределённость как стартовая "погрешность" прогноза, а затем в обучающей выборке ищутся похожие по структуре молекулы (по сходству Танимото на отпечтаках ECFP4) с уже измеренными значениями свойства. Каждая такая молекула-сосед учитывается как "шумное измерение" (чем структурно ближе соседняя молекула, тем больше ей доверия) и через байесовское обновление (по сути, фильтр Калмана) прогноз для новой молекулы сдвигается в сторону соседей. Модель при этом не переобучается - все веса нейросети остаются замороженными.

Главное усовершенствование статьи - PG-EviKal. Авторы справедливо замечают: структурно похожие молекулы не обязательно похожи по интересующему свойству. Такое несоответствие часто называют activity cliff - небольшое изменение структуры резко меняет свойство. Поэтому вместо того чтобы отбирать соседей исключительно по структурному сходству, они обучают отдельную небольшую сеть, которая предсказывает, насколько две молекулярных структуры могут отличаться именно по значению свойства, и ранжирует кандидатов с оглядкой на это. Нам эта идея особенно близка: разделение "похожести по структуре" и "похожести по свойству" - гораздо более химически осмысленный критерий, чем опора на одну лишь структурную схожесть.

На 16 классических датасетах (растворимость ESOL и FreeSolv, липофильность, связывание с рецепторами CDK2, hERG, 5-HT2A, D2, фотовольтаика HOPV, квантово-химические расчеты QM7/8/9 и другие) PG-EviKal снижает ошибку предсказания (RMSE) относительно исходной эвиденциальной модели на 14 из 16 датасетов, в среднем на 19.4%, и заодно улучшает калибровку неопределённости.

Из явных ограничений: подход опирается только на структуру молекулы и само измеренное значение свойства, не учитывая дополнительные переменные экспериментальных условий (температуру, концентрацию, растворитель и т.п.), которые нередко определяют разброс измерений в реальных данных. Кроме того, нет сравнения ни с зарекомендовавшими себя методами оценки неопределенности (байесовскими нейросетями, регрессией гауссовских процессов), ни с более продвинутыми моделями (например, с классической графовой Chemprop, уже давно содержащей эвиденциальный режим обучения и предсказания), так что говорить о методологической революции в моделях оценки неопределенности в химии пока рано.

Тем не менее сама идея показательна: она возвращает внимание к тому, что оценка неопределённости - не просто побочный отчёт о качестве модели, а сигнал, который можно и нужно использовать напрямую.
  • ❤ 3
  • 👍 2
  • 🔥 1
More from @digichemistry
  1. Sep 11, 2026🧪 Сегодня в Международном центре Физики наноструктур прошел научный семинар совместно с к…
  2. Jul 24, 2026Расшифровка масс-спектров при помощи ML: как выглядит прогресс, если присмотреться Примеча…
  3. Jul 2, 2026Каскадное обучение — новый виток развития хемоинформатики В органической химии давно извес…
  4. Jun 26, 2026Алгоритмы искусственного интеллекта способны моделировать структуру и свойства сложных хим…
  5. Jun 23, 2026Спектроскопия ЯМР парамагнитных комплексов металлов: современное состояние Заведующий цент…
  6. Jun 16, 2026🎓 В Институте Химии Силикатов им. И.В. Гребенщикова с 1 - 5 июня прошло «XXV Всероссийско…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →