Время замечательных «ламповых» исследований еще не ушло, но быстро уходит
Праведным гневом полыхают посты матерых исследователей об аналитике, которую теперь выпускают журналисты, блогеры и вообще все кому не лень, вооружившись нейросетью. Потому что социальное исследование, как и наука вообще, плохо поддается наскоку.
Не примите за брюзжание, но с данными нейросети и правда пока работают ненадежно. В эксперименте МВФ ChatGPT-4o проверили на элементарной задаче. Ее попросили собрать в таблицу темпы экономического роста стран G7 по последнему World Economic Outlook. Один и тот же запрос повторили 25 раз, а затем сверили каждую цифру с данными отчета.
Нейросеть оказалась постоянна только в своем непостоянстве. Когда запрос повторяли в одном длинном диалоге, с реальными данными совпала примерно треть выданных значений. В отдельных новых чатах доля совпадений упала вполовину. А когда модели загрузили сам документ, с оригиналом совпали только 14% цифр. Все потому, что ИИ легко съедает контекст.
В этом моменте многим захочется приложить руку к сердцу со словами, что настоящая аналитика требует настоящего исследователя. И спорить с этим трудно. В отношениях с ИИ действительно нужно оставаться квалифицированным заказчиком. Но это не повод возвращаться к логарифмической линейке, когда под рукой оказался калькулятор.
Для работы с данными уже вырастает своя ИИ-нативная инфраструктура. В этом году Статистическая комиссия ООН поддержала отдельное направление по AI-ready официальной статистике. Google тем временем собрал Data Commons — огромный граф публичных данных из множества источников. К нему агент может подключиться через MCP, сначала подтянуть метаданные, разобраться, что там вообще есть, выбрать нужное для задачи и только потом забирать сами значения уже с необходимым контекстом.
DoWhy, CausalVerify, REPRO-Bench, SocSci-Repro-Bench, системы scientific claim verification… Вокруг ИИ-аналитики уже разрастается целое дерево библиотек, бенчмарков и систем проверки, которые покрывают разные этапы исследования от причинных предположений и выбора метода до расчетов, воспроизводимости и проверки итогового вывода.
Пока это не единая система и далеко не все ее части достаточно надежны для автономной работы. Но тем лучше для амбициозных исследователей и университетов. Здесь открывается куда более интересное поле, чем очередная войнушка с ChatGPT.
Самое время теперь доставать проверенные методички из профессорских портфелей и переводить их в исполняемую форму. Собирать для разных типов исследований свои harness’ы, в которые зашита вся рабочая система — скиллы, инструменты, процедуры и проверки от работы с данными до интерпретации результата.
Пока еще можно говорить свысока, что нейросетевые исследования по определению менее достоверны. Но бьюсь об заклад, продлится это недолго. Хорошо собранная ИИ-система способна за короткое время переварить такой объем источников, гипотез и взаимных проверок, который смертному просто не доступно.
Летом Mantic показала результат лучше, чем все 676 участников Metaculus Cup, которые соревнуются в оценке вероятности будущих событий. S-Researcher собирает дизайн эксперимента, запускает тысячи синтетических участников и анализирует результаты. В симуляции она воспроизвела классический эффект модели Аксельрода. А в кейсе о распределении внимания учителя система сделала вывод, аналогичный результатам реальных полевых исследований.
Post #206
51
