Ложное превосходство
Выводы из практики оценки ИИ-моделей в материаловеденииВ области прикладного искусственного интеллекта давно вошли в практику бенчмарки — специализированные тесты, дающие количественную оценку качеству работы модели. В области химии их роль часто выполняют открытые базы данных, например, база данных квантово-химических параметров молекул QM9, и протоколы тестирования качества. К последним почти всегда относится набор метрик (например, средних ошибок предсказания) и способ их агрегации — так химики получают, казалось бы, наглядный способ сравнения качества разных моделей и инструмент подбора наилучшей.
Так, одной из наиболее частых тем для публикации и обсуждения в области химической информатики является достижение очередной отметки качества работы модели для того или иного набора данных по выбранному набору метрик. Согласно тренду подобных публикаций, кажется, уже скоро многие задачи предсказания свойств по структуре (т.н. QSAR/QSPR) будут раз и навсегда решены искусственным интеллектом, без необходимости проводить какие-либо сложные расчёты и, тем более, эксперименты. Так почему же подавляющее большинство этих чудо-моделей так и не находят своего применения и не используются в своих работах другими профильными учёными?
Более того, на части бенчмарков (QM9 как раз из их числа) модели уже давно достигли уровня статистической погрешности — тем не менее, для этих бенчмарков продолжают выходить публикации с ещё более впечатляющими метриками, утверждающими о дальнейшем "прогрессе" в данной области.
Эту несоответствие чувствуем не только мы — на эту тему в Computational Materials Science не так давно вышла важная
обзорная статья от авторов популярных бенчмарков
ChemBench и
MaCBench.
Несколько ключевых идей из публикации:• Измеряйте то, что имеет значение в реальном миреМногие бенчмарки страдают от «ошибки Макнамары»: они оценивают то, что легко посчитать (например, среднеквадратичную ошибку на DFT-данных), игнорируя то, что сложно, но критично — например, синтезируемость материала, его стабильность при эксплуатации или стоимость прекурсоров. Высокая точность предсказания энергии образования ≠ реально работающий материал.
• Данные определяют, что вы измеряетеМодель, обученная на DFT-расчётах, предсказывает не экспериментальные свойства, а систематические ошибки функционала (например, PBE-undershoot для ширины запрещённой зоны). Сравнивать такие модели с теми, что обучены на экспериментальных данных, — сравнивать яблоки с апельсинами.
• Метрики — это выбор, а не данностьСредняя абсолютная ошибка (MAE) или точность (accuracy) часто не отражают научной или инженерной ценности модели. Для задач подбора материалов по заданным критериям важнее top-N discovery yield (то есть содержание искомой структуры среди первых N вариантов, предложенных моделью), для генеративных моделей — физическая реализуемость структур. Даже способ агрегации результатов (среднее vs. взвешенное) может полностью перевернуть рейтинг моделей (см. рис. 1 в статье!).
• Бенчмарки устаревают — и это нормальноQM9 и MatBench Discovery уже близки к насыщению: модели достигли предела шума в данных. Продолжать использовать их как основной критерий — рисковать «фантомным прогрессом». Авторы призывают заранее определять критерии устаревания бенчмарков и планировать их преемников.
• Прозрачность — обязательнаЧтобы сравнения были честными, авторы предлагают внедрить практику структурированных «оценочных карточек» (
evaluation cards), содержащих ключевую информацию о методологии тестирования и потенциальных недостатках модели.
Ключевой вывод:Оценка ИИ-моделей — это не техническая деталь, а фундамент научного прогресса. Плохая метрика, устаревший бенчмарк, отсутствие анализа ошибок модели и домена применимости — всё это ведёт к неверным трактовкам результатов, закреплению плохих практик, ложным открытиям и потере доверия ко всей области химической информатики и цифрового материаловедения.
Центр Цифрового материаловедения ИОНХ РАН призывает — давайте вместе строить культуру ответственного измерения и оценки!