#processdev #chemoinformatics #tools
Время на прочтение - 5 минут
Сложность - 5/10
В пылу исследовательской деятельности каждому из нас приходится обрабатывать большое количество информации. Для подготовки литературного обзора в ход идут статьи, патенты и всё что плохо лежит в этих ваших интернетах.👀
Конечно большая часть вводных представляет собой текстовый формат, но если вам посчастливилось работать в околохимической области, то приходится сталкиваться еще и со структурными формулами. Органическую химию не так просто вписать в строчку, чтобы было всем сразу понятно.🧪
Везет если статья или патент представляет собой текст, и в нем можно найти CAS номер или название молекулы, которые в свою очередь можно поискать в разных базах. Но что если никаких идентификационных данных нет или того хуже - документ является просто изображением, а у вас стоит задача собрать все молекулы в читаемый формат.🤕
Тут на помощь приходят OCSR (optical chemical structure recognition) инструменты. Они, как и продукты по распознаванию текста, позволяют перевести изображение в формат, читаемый машинами. Только в данном случае целевой формат будет представлять собою SMILES молекулы (Simplified molecular-input line-entry system). У такой формы записи есть свои нюансы, но это сейчас не важно, она позволяет представить любую молекулу как раз в строчном виде, который является съедобным для химического поисковика.🍄
Конечно есть коммерческие программы, которые в принципе неплохо работают, но к счастью для слабых кошельком, имеются open-source альтернативы. На данный момент, доступных вариантов сейчас больше чем несколько, но я бы хотел выделить парочку🔜
Decimer.ai и Molscribe - принцип действия обеих программ схож:
1️⃣ Вначале идет сегментация картинки, чтобы найти где там изображены молекулы.
2️⃣ Затем происходит перепроверка наличия формулы на кропе и его классификация, ибо сетки обучены на разных датасетах и надо прилепить изображение к нужной модели
3️⃣ Ну и наконец уже происходит трансформация изображения, с помощью предобученной модели, в SMILES
Чтобы воспользоваться сием великолепием можно конечно установить библиотеки, упомянутые в статьях и попрыгать с бубном, а можно просто воспользоваться веб-интерфейсами и не париться.🙃
Decimer.ai - лучше справляется с нарисованными от руки молекулами. Почерк с врачебного рецепта не разберет, но в целом с лабораторными записями может работать
&
MolScribe - достаточно бодро прожёвывает напечатанные формулы, даже с шакальным качеством, но конечно не стоит ожидать многого от макроциклов в 100x100 пикселей
Невредные советы😉:
*️⃣Не стоит загружать туда огромный патент (хотя кто вас остановит) и надеяться что программа его быстро прожует, всё таки это бесплатные ресурсы. Лучше тыкать модель носом в скриншот части страницы с молекулами, чтобы она перекатала его в SMILES.
*️⃣Как и со всеми бесплатными инструментам, стоит быть аккуратным с цифровой безопасностью, если вы оцифровываете что-то сокровенное, то может всё-таки, стоит потратить несколько минут на ручную перерисовку.
*️⃣И если же всё-таки у вас есть пара лишних часов, вам очень надо и вы отважитесь запускать модели локально - модули сегментации мягко говоря шалят и немного путаются если молекул на странице больше чем 5-6 штук, поэтому лучше подготовить строчную предобработку изображений, чтобы точно также тыкать модель носом, но уже автоматически.
- Пост - 30 минут
- Иллюстрации - 2 минуты
