🧪 ИИ превзошел людей в зрении и текстах, но пасует перед химией. Почему?
Вездесущий ИИ уже управляет автономными машинами и пишет сложные коды. Однако в химии машинное обучение до сих пор спотыкается. И проблема — не в мощности алгоритмов, а в методологии.
Сотрудники Центра цифрового материаловедения ИОНХ РАН (Павлов А.А., Рекут Н.А., Злобин И.С.) проанализировали ситуацию и выделили 4 главных барьера современной хемоинформатики:
🚧 1. Разнородность классов
Модель, предсказывающая свойства лекарств, совершенно бесполезна для полимеров или кристаллов. Для каждого класса данных нужно всё начинать с нуля.
🚧 2. Дефицит структурированных данных
Научных статей — горы, но машиночитаемой информации — крохи. Спектры, графики, структуры молекул часто существуют только в виде растровых картинок, а не в цифровых базах.
🚧 3. Скрытые параметры
В базах данных химию сводят к паре «структура → свойство», забывая про методику измерения, геометрию реактора или историю термообработки образца. А для ИИ это критические скрытые переменные.
🚧 4. «Ошибка выжившего»
Публикуют только успешные синтезы и рекордные свойства. Огромный массив неудачных реакций и тупиковых веществ остается в столах. Модели не знают, как выглядит провал, и потому плохо предсказывают реальность.
Что делать? Авторы уверены: барьеры преодолимы. Нужно массово оцифровывать неструктурированные данные, открыто публиковать отрицательные результаты и обогащать базы данных полными протоколами экспериментов.
Подробнее на сайте ХИА
Post #45
2.43K
- 👍 9
- ❤ 2