Как измерить «общий научный интеллект» у LLM
LLM умеют объяснять сложные вещи и писать код, но в науке этого мало. Там важен полный исследовательский цикл: найти и понять источники, придумать гипотезу, спланировать и провести эксперимент, а потом аккуратно разобрать результаты. Проблема в том, что мы долго оценивали ИИ не как «ученого», которому нужно доводить работу до конца и не ошибаться на числах, единицах измерений и самой процедуре исследований.
И вот тут начинается самое интересное: когда моделям дают реальные исследовательские задачи, лучшие из них внезапно набирают около 30 баллов из 100. Они могут выглядеть убедительно в рассуждениях, придумывать свежие идеи и даже писать исполняемый код — но все ломается на последнем шаге, либо агенты путают условия задачи и делают рассуждения слишком линейными.
В обзоре разберем, как устроен SGI-Bench, почему авторы оценивают не ответы, а исследовательский процесс, и какие слабые места он вскрывает у современных ИИ-моделей.
📜 Полный обзор
Post #109
123