Хемоинформатика: новое - это хорошо забытое старое
Хемоинформатика - это область науки на стыке химии и математики, которая занимается математическим анализом химических знаний. емоинформатика охватывает ряд задач: предсказание свойств и направленный дизайн новых химических веществ и материалов, создание структурированных баз знаний для поиска, сопоставления и математического моделирования, автоматизация ряда этапов научного химического поиска.
Сегодня хемоинформатику часто связывают с машинным обучением и ИИ, однако эти методы стали лишь новым этапом развития уже ложившейся области. Ещё задолго до нынешнего бума в ней использовались QSAR/QSPR-подходы, дескрипторы, фингерпринты, строковые представления молекул и методы статистического моделирования, многие из которых были предложены в 1960–1980-х годах.
Ниже разобрали ключевые вехи в истории хемоинформатики:
1964 год. Cтатья «ρ-σ-π Analysis. A Method for the Correlation of Biological Activity and Chemical Structure» считается первой успешной попыткой связать биологическую активность с физико-химическими свойствами через математическое моделирование. Так
зародились подходы QSAR/QSPR.
1965 год. В работе «The Generation of a Unique Machine Description for Chemical Structures» предложен алгоритм канонического кодирования молекул на основе топологии связей. Именно из этой идеи вырос алгоритм подсчёта так называемых круговых фингерпринтов (circular fingerprints), который актуален по сей день и используется во всех основных хемоинформатических пакетах (отпечатки Моргана).
1979 год. Компания Molecular Design Limited представляет MACCS keys. Они вводят идею подструктурных фингерпринтов: молекула описывается бинарным вектором фиксированной длины, где 1 или 0 указывают на наличие или отсутствие конкретной подструктуры из заданного набора.
1985 год. В статье «Topological Pharmacophores. New Methods and Their Application to a Set of Antimalarials» представлены алгоритмы LOGANA и LOCON, позволяющие решать задачи бинарной классификации и регрессии на основе булевой алгебры; их можно рассматривать как ранних предшественников деревьев решений в химии.
1986 год. Работа «Atomic physicochemical parameters for three-dimensional structure-directed quantitative structure-activity relationships»является одной из фундаментальных работ по расчёту физико-химических дескрипторов, на которых и сегодня строятся молекулярные признаки для моделей машинного обучения.
1988 год. Статья «SMILES, a chemical language and information system» презентует SMILES - основную строковую кодировку молекул в современных химических базах данных.
1988 год. В работе «Comparative molecular field analysis (CoMFA)» представлен метод 3D-QSAR, решающий проблему неэффективного предсказания активности вещества на рецепторе на основе только 1D- и 2D-представлений.
1997 год. Статья «Experimental and computational approaches to estimate solubility and permeability in drug discovery and development settings». Знаменитое «Правило пяти» Липински. Эта работа заложила строгие правила оценки «лекарственного подобия», став важнейшим фильтром в виртуальном скрининге и разработке новых препаратов.
1998 год. «Chemoinformatics: What is it and How does it Impact Drug Discovery». Официальное закрепление термина, формулирующее задачу дисциплины как навигацию в химическом пространстве. Примечательно, что к этому моменту область фактически существовала уже более 30 лет.
Современные вычислительные возможности, нейросетевые и оптимизационные подходы открыли для хемоинформатики огромные, видимые невооружённым взглядом возможности. Однако важно понимать: без основ в виде описанных выше подходов и концепций этого успеха не будет.
‼️А про то, какие трудности встают на пути хемоинформатиков сейчас, будет наш следующий пост.
❓А вы используете возможности хемоинформатики в работе?
Да - 👍
Нет, но хотел бы - 🔥
Нет и не хочу - 😐
Я сам - хемоинформатик - 🏆
Post #41
2.99K
- 👍 11
- 🔥 7
- ❤ 5
- 🏆 3