TGViewer
επ.Pharm επ.Pharm @epi_pharm · 726 subscribers
Post #54 982
❓ChemLLM Quiz
#chemoinformatics #AI
Время на прочтение - 5 минут
Сложность - 3/10


Каждый раз после выхода новой языковой модели разработчики стремятся сравнить своё творение с конкурентами, демонстрируя всё более впечатляющие цифры на популярных бенчмарках. В таких тестах чаще всего оценивается способность к логическому рассуждению, написанию кода и умение отвечать на общие вопросы👍

Но нас интересует не очередной заменитель IT специалиста, а химия. Год назад я уже упоминал проект ChemCrow, который продолжает развиваться. Появляются и другие специализированные решения, но до сих пор остаётся открытым важный вопрос: а судьи кто🤔

Очевидно, что классические общие тесты не подходят для оценки химических знаний - нужны специально подобранные задачи, отражающие специфику дисциплины. Именно эту проблему взялась решить группа авторов из университета имени Фридриха Шиллера в Йене и др., составившая бенчмарк ChemBench из 2700 химических вопросов, охватывающих аналитическую, органическую и физическую химию, а также другие разделы.

Например, вопрос из technical_chemistry🥃:
Which method among the following is the least suitable for scaling up?
A. Crystallization
B. Distillation
C. Liquid-liquid extraction
D. Rotary evaporation


Авторы протестировали доступные на рынке модели LLM в их базовом виде - без агентов и расширений типа RAG. Результаты получились неоднородными, однако среди коммерческих моделей явным лидером в рейтинговой таблице сейчас является свежая Claude 3.7 Sonnet, а из опенсорсных моделей неожиданно хорошо выступила LLama-3.1-405B - очень приятный сюрприз для любителей сомнительных развлечений тех, кто любит экспериментировать с локальными решениями (достаём свои A100 с полки)💵

Очевидным этапом исследования стало сравнение чат-ботов с реальными химиками: в качестве живой контрольной группы привлекли 19 аспирантов. Неудивительно, что на простые, прямые вопросы модели отвечали точнее людей. Однако когда требовалась более глубокая логика, например, определить число возможных изомеров молекулы, люди всё ещё держали фронт💪
➖➖➖
Это конечно не прорыв, но ещё один важный элемент в фундамент понимания того, где и как LLM действительно могут быть полезны в химии.
Помогать - да. Принимать решения за людей - очевидно, пока еще нет😬

Как и в других сферах, доверять чат-ботам без проверки пока рано, особенно там, где цена ошибки высока: сложные реакции, дорогостоящие реагенты и вопросы безопасности.

Тем не менее автоматизированный поиск литературы, простейшие расчёты и базовая обработка данных уже сегодня выглядят вполне реалистично и перестали казаться фантастикой, как это было 10 лет назад. Посмотрим насколько полезны будут LLM решения в химии через год👀

📕Статья: A framework for evaluating the chemical knowledge...
🤗Рейтинговая таблица и сами вопросы: ChemBench
👩‍💻Добавить свой вопрос: Lamalab

Wrong? Sure. But impressively fast.

Пост - 45 минут
  • 🔥 8
  • ❤ 1
More from @epi_pharm
  1. Jul 4, 2026#general Основа рынка - динамика. Она может быть положительной или отрицательной, но главн…
  2. Jul 4, 2026#general Доброго здравия, уважаемые подписчики. Извиняюсь, что давно тут не появлялся, но…
  3. Dec 31, 2025🔗Полезные (и не очень) ссылки #tools Время на прочтение - 5 минут Сложность - 1/10 В это…
  4. Dec 31, 2025🎄С Новым Годом! #general Не буду мучать вас итогами года💬 Вместо этого пожелаю всего сам…
  5. Dec 8, 2025🔥АФС: между молекулой и продуктом #processdev Время на прочтение - 7 минут Сложность - 5/…
  6. Nov 19, 2025🛸Химия знаний: роль онтологий #career #ai Время на прочтение - 5 минут Сложность - 4/10 С…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →