TGViewer
AI_Reformer: Образованию нужен AIR AI_Reformer: Образованию нужен AIR @aireformer · 1.28K subscribers
Post #195 247
Исследование: ИИ-агенты пока не справляются с настоящей научной работой

Передовые ИИ-агенты уже умеют решать сложные задачи, если результат легко проверить. Но когда нужно самому выбрать гипотезу, оценить результат, отказаться от неудачного подхода и попробовать другой, их возможности резко падают. Это показал эксперимент исследователей из Принстона и британского Института безопасности ИИ.

Ученые выбрали две еще не опубликованные работы и попросили их авторов сформулировать главные исследовательские задачи, которые они решали. Затем те же задачи дали ИИ-агентам, но без доступа к самим статьям и готовым результатам. У систем было шесть суток, вычислительные ресурсы и API-кредиты на тысячи долларов. На выходе от них ждали полноценные научные статьи. В итоге эксперты отвергли обе.

Агенты находили перспективные идеи, но проверяли их слишком поверхностно. Слабые первые результаты часто заставляли их сразу бросить направление. Если выбранный путь заходил в тупик, ИИ редко менял стратегию. Даже обнаружив серьезную ошибку при самопроверке, он чаще добавлял оговорку, чем переделывал исследование.

Обе системы закончили работу раньше срока и потратили меньше половины бюджета. Они также пропускали часть прямых инструкций, например просьбы проверить другие подходы и тщательнее перепроверить результат.

Неопубликованные исследования выбрали специально, чтобы агенты не могли найти готовый ответ в интернете или обучающих данных. Такой подход авторы называют «теневой оценкой». ИИ получает ту же задачу, которую раньше решали ученые, а затем его результат сравнивают с оригинальной работой. Так можно увидеть, какую часть всего исследования агент способен пройти самостоятельно.

От этого напрямую зависит, насколько ИИ вообще может ускорить научную работу. Если часть этапов все равно остается человеку, именно они становятся ограничением. По закону Амдала даже стократное ускорение одной части работы не сделает весь процесс в сто раз быстрее. На схеме слева автоматизировано почти все, поэтому выигрыш огромен. Справа заметная часть работы остается человеку, и общий эффект резко падает.

Открытая научная работа может оказаться как раз таким узким местом, которое пока плохо поддается автоматизации. Впрочем, сами авторы считают выводы предварительными. Эксперимент провели всего на двух исследованиях.

#debug
  • 👍 1
More from @aireformer
  1. Sep 22, 2026Как бы нам ни хотелось обратного, время замечательных «ламповых» исследований безвозвратно…
  2. Sep 22, 2026Время замечательных «ламповых» исследований еще не ушло, но быстро уходит Праведным гневом…
  3. Sep 22, 2026Промты, AI-сервисы, данные, автоматизация и IT-решения для повседневной работы. Партнеры с…
  4. Sep 19, 2026Connected Papers собирает карту литературы вокруг одной статьи Инструмент выручает, когда…
  5. Sep 17, 2026Шесть недель с ИИ дали школьникам прирост, сопоставимый с полутора годами учебы Всемирный…
  6. Sep 15, 2026Прощай, дорогая редакция Раньше за внимание читателя боролись редакции. Теперь придется пр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →