В мае Penn State опубликовал любопытный пресс-релиз о работе Robert Novy-Marx и Mihail Velikov. Исследователи показали, что с помощью современных моделей можно практически поставить производство научных статей на поток.
Авторы перебрали более 30 тысяч потенциальных предикторов доходности акций, отобрали 95 результатов, прошедших статистические проверки, а затем предложили ИИ сформировать для каждого несколько теоретических объяснений и оформить их в виде полноценных научных статей.
Результат — 380 статей примерно за 12 часов.
На эту работу интересно отреагировал Joep Cornelissen в статье “The Artificial Intelligence Con: The commodification of theory and the new and improved credibility crisis”. Если немного упростить, его мысль состоит в следующем. Опасность не в том, что искусственный интеллект научится плохо придумывать теории. Наоборот. Он научится очень быстро, очень дёшево и практически в неограниченном количестве создавать вполне убедительные теоретические объяснения для обнаруживаемых ИИ закономерностей.
Здесь возникает ещё более интересная проблема. Уже сегодня технически несложно построить примерно такой конвейер: база данных → агент поиска интересных закономерностей → агент формулирования гипотез → агент статистической проверки → агент проверки устойчивости результатов → агент поиска литературы → агент поиска альтернативных объяснений и попытки опровергнуть результат → агент подготовки текста статьи → агент поиска подходящего журнала → ученый (внезапно! 😉), бегло просматривающий результат → агент подачи рукописи → агент переписки с редакцией и подготовки ответов рецензентам.
Повторяем цикл много раз – на выходе произвольное количество довольно приличных статей. Важно то, что на таком конвейере будет производиться вполне приличные результаты: данные настоящие, статистические методы выбраны корректно, все расчёты воспроизводимы, источники существуют и действительно подтверждают утверждения, мспользование ИИ честно раскрыто, результаты не сфальсифицированы, ответы рецензентам содержательны.
Возникает простой вопрос: какая именно норма академической этики или научной добросовестности здесь нарушена? Мой ответ – скорее всего нарушений нет.
Я знаю довольно много примеров того, как авторы публикуют по выражению моего учителя Константина Владимировича Рудакова «параметрическое семейство статей». То есть регулярно выходит публикации, в которых проводится анализ свежих статистических данных по той или иной теме. То есть, проблема возникла не из-а ИИ, но развитие ИИ может довести ситуацию до абсолюта.
И тогда появляется другой, гораздо более сложный вопрос: а является ли такая деятельность наукой?
Когда-то путешествие в малоизученную часть мира само по себе могло быть научной экспедицией. Поярков в XVII веке исследовал бассейн Амура. Экспедиции Невельского в XIX веке исследовали низовья Амура, Татарский пролив и доказали, что Сахалин — остров.
Сегодня можно проехать, проплыть или пройти примерно теми же маршрутами. Это может быть сложно, интересно и наверное местами опасно. Но географическим открытием такое путешествие уже не станет.
Изменилось не действие. Изменилось состояние знания — и вместе с ним граница научной задачи.
Возможно, сейчас нечто подобное начинает происходить и с целым классом исследований, основанных на данных.
Если поиск закономерности, формулирование гипотезы, её проверку, поиск литературы, написание статьи и даже взаимодействие с журналом можно превратить в автоматический технологический процесс, то производство ещё одной корректной статьи может постепенно перестать восприниматься как самостоятельный научный результат.
И поэтому вопрос об ИИ в науке, возможно, стоит формулировать несколько иначе. Не только: «Можно ли использовать ИИ при проведении исследования или подготовке статей?» но и: «Не изменит ли массовое использование ИИ саму границу между тем, что мы называем наукой, и тем, что наукой уже не является?»
Post #171
1.2K