#chemoinformatics #AI
Время на прочтение - 5 минут
Сложность - 3/10
Каждый раз после выхода новой языковой модели разработчики стремятся сравнить своё творение с конкурентами, демонстрируя всё более впечатляющие цифры на популярных бенчмарках. В таких тестах чаще всего оценивается способность к логическому рассуждению, написанию кода и умение отвечать на общие вопросы👍
Но нас интересует не очередной заменитель IT специалиста, а химия. Год назад я уже упоминал проект ChemCrow, который продолжает развиваться. Появляются и другие специализированные решения, но до сих пор остаётся открытым важный вопрос: а судьи кто🤔
Очевидно, что классические общие тесты не подходят для оценки химических знаний - нужны специально подобранные задачи, отражающие специфику дисциплины. Именно эту проблему взялась решить группа авторов из университета имени Фридриха Шиллера в Йене и др., составившая бенчмарк ChemBench из 2700 химических вопросов, охватывающих аналитическую, органическую и физическую химию, а также другие разделы.
Например, вопрос из technical_chemistry🥃:
Which method among the following is the least suitable for scaling up?
A. Crystallization
B. Distillation
C. Liquid-liquid extraction
D. Rotary evaporation
Авторы протестировали доступные на рынке модели LLM в их базовом виде - без агентов и расширений типа RAG. Результаты получились неоднородными, однако среди коммерческих моделей явным лидером в рейтинговой таблице сейчас является свежая Claude 3.7 Sonnet, а из опенсорсных моделей неожиданно хорошо выступила LLama-3.1-405B - очень приятный сюрприз для
Очевидным этапом исследования стало сравнение чат-ботов с реальными химиками: в качестве живой контрольной группы привлекли 19 аспирантов. Неудивительно, что на простые, прямые вопросы модели отвечали точнее людей. Однако когда требовалась более глубокая логика, например, определить число возможных изомеров молекулы, люди всё ещё держали фронт💪
➖➖➖
Это конечно не прорыв, но ещё один важный элемент в фундамент понимания того, где и как LLM действительно могут быть полезны в химии.
Помогать - да. Принимать решения за людей - очевидно, пока еще нет😬
Как и в других сферах, доверять чат-ботам без проверки пока рано, особенно там, где цена ошибки высока: сложные реакции, дорогостоящие реагенты и вопросы безопасности.
Тем не менее автоматизированный поиск литературы, простейшие расчёты и базовая обработка данных уже сегодня выглядят вполне реалистично и перестали казаться фантастикой, как это было 10 лет назад. Посмотрим насколько полезны будут LLM решения в химии через год👀
📕Статья: A framework for evaluating the chemical knowledge...
🤗Рейтинговая таблица и сами вопросы: ChemBench
👩💻Добавить свой вопрос: Lamalab
Wrong? Sure. But impressively fast.
Пост - 45 минут
