Задумывались ли вы когда-нибудь, что было бы, если бы ИИ мог не только генерировать идеи и код, но и писать научные статьи? И вот команда из Токийского университета решила, что пора сделать следующий шаг и предложила решение: Jr. AI Scientist — младший ИИ-исследователь, который работает, как честный сотрудник на стартовой позиции. Он помогает находить проблемы в статье, предлагает улучшения, проверяет их и даже создает черновик научной работы. Так давайте разберемся, как это работает.
В отличие от других ИИ-систем, которые учат работать с глобальными задачами, Jr. AI Scientist ограничен одной статьей, её кодом и данными. Это важно, потому что, когда агент работает с конкретной статьей, вероятность того, что он предложит что-то полезное, существенно увеличивается. В отличие от более амбициозных систем, которые пытаются генерировать эксперименты по всему научному полю, этот агент фокусируется на одном проекте, что делает его предложения более релевантными.
Как это работает под капотом? 😮💨
Итак, процесс начинается с того, что агент получает статью и её LaTeX-исходники. Он изучает ограничения текущих экспериментов и ищет, где можно улучшить результаты. Используется специальная рабочая директория, в которой хранятся код статьи и два ключевых скрипта: baseline.py и plot.py. Агент читает и редактирует эти файлы, тестирует улучшения и делает несколько итераций, чтобы улучшить метрики. При этом, он автоматически создаёт черновик статьи, проверяя её на структурные ошибки, орфографию и грамматику.
Что показывает практика? 😐
Jr. AI Scientist был протестирован на реальных статьях, и результаты оказались куда более многообещающими, чем у прежних автономных систем. Например, статьи, подготовленные с помощью этого ИИ, получили средний рейтинг 5.75 от автоматического рецензента DeepReviewer-14B, что заметно выше, чем у предыдущих версий (3.30). Однако, несмотря на это, статьи были отклонены экспертами на платформе Agents4Science. Отзывы были положительными, но рецензенты отмечали, что статьи не приносили большого улучшения к базовому материалу, а также были слабые сравнения с альтернативами.
Что не так? 😺
Несмотря на успехи, агент всё ещё не идеален. Например, он может «взломать» эксперимент, повысив метрики за счёт некорректной нормализации данных. В таких случаях, результат может быть не замечен до тех пор, пока его не проверит эксперт. Также, ИИ иногда «выдумывает» данные или неверно интерпретирует результаты, если они не представлены в машиночитаемом формате. Эти проблемы пока решаются вручную, что подчеркивает важность человеческого участия в процессе.
Однако, с каждым шагом этот ИИ становится всё более полезным. И, похоже, эпоха автономных исследователей начинается не с гениев, а с «джуниоров».
Data Science
