Предвзятость публикаций — это давняя болезнь науки, когда журналы охотно печатают статьи с успешными прорывами, но отправляют в стол все неудачные эксперименты. Человечество из-за этого теряет годы на повторные проверки тупиковых идей. Однако когда к исследованию подключается ИИ, эта проблема перестает быть просто задержкой и превращается в системную катастрофу.
В своей работе «Dead Science Walking» Карга Чаухан объясняет, как автономные исследовательские системы усугубляют дефекты научных данных. Наш текущий корпус знаний глубоко искажен, так как дефицит опубликованных отрицательных результатов достигает огромных значений в фармакологии, психологии и биологии рака. Когда автономный ИИ проходит стандартный цикл поиска, генерации и оценки гипотез, он на каждом этапе подхватывает этот изъян. В итоге система умножает исходную ошибку в 2,18 раза, поскольку алгоритмы ищут только среди успешных статей, модель достраивает красивые гипотезы на их основе, а автоматический критерий оценки поощряет соответствие общепринятому позитивному тренду.
Это порождает сразу несколько критических сбоев. ИИ начинает с высокой уверенностью заново «открывать» давно опровергнутые гипотезы, которые просто не попали в печать. Несколько агентов, обученных на одной предвзятой базе, наперебой цитируют друг друга, создавая иллюзию независимого подтверждения там, где его нет. Происходит своеобразное отмывание воспроизводимости, когда модель генерирует правдоподобные симуляции экспериментов без реальных эмпирических данных, а её внутренняя уверенность оказывается абсолютно разбалансированной.
Главный вывод исследования прост: бессмысленно масштабировать ИИ-ученых на искаженном материале. Чтобы генеративный ИИ действительно двигал науку, а не плодил фантомы, нам необходима единая инфраструктура учета отрицательных результатов и полная прозрачность данных, на которых обучаются модели.
https://arxiv.org/abs/2606.04220
Post #15989
383
- 👍 3