🔬 Может ли ИИ стать настоящим учёным?
В моём дипломе по окончании аспирантуры написано: «исследователь». И в этом звании — суть человеческого стремления к новому, к открытиям, к преодолению границ знания.
Но способен ли на это искусственный интеллект?
Недавно я наткнулся на статью "PaperBench: Оценка способности ИИ воспроизводить исследования ИИ", и это одна из недавних попыток ответить на этот вопрос.
Исследователи разработали бенчмарк — PaperBench — который тестирует, может ли ИИ-агент самостоятельно воспроизвести современную научную работу в области машинного обучения: понять её, переписать код с нуля, провести эксперименты и получить те же результаты, что и авторы оригинала.
❔Что внутри PaperBench:
- 20 современных научных статей по ML, написанных учёными
- Каждая статья разбита на «рубрики» — отдельные научные результаты (всего 8316 таких элементов).
- Каждый рубрикатор составлялся совместно с автором оригинальной статьи.
- Задача ИИ: воспроизвести результаты, не имея доступа к исходному коду авторов.
ИИ получает только саму статью и техническое приложение к ней. Он должен подготовить репозиторий с полным кодом и файлом playback.sh, который запускает воспроизведение эксперимента. Заявка засчитывается как успешная, если скрипт воспроизводит эмпирические результаты.
🔍Результаты:
- Тестировали GPT-4o, o1, o3-mini, DeepSeek-R1, Claude 3.5 Sonnet и Gemini 2.0 Flash.
- Лидером стал Claude 3.5 Sonnet с результатом 21% успешных воспроизведений (из 100%).
- Модель o1 показала 13.2%, остальные — менее 10%.
Все агенты сталкивались с проблемами в стратегическом планировании и выполнении многошаговых задач на длинной дистанции (временной лимит — 12 часов).
👨🔬А что насчёт людей?
В эксперименте участвовали и живые исследователи, которым дали 48 часов на аналогичную задачу (выборка из 3 статей). Их результат — 41.4% против 26.6% у o1.
Примечательно, что ИИ показывает быструю отдачу в первые часы (много кода, быстро), но дальше... тупик⛔️
📝 Что это говорит о текущем состоянии ИИ?
ИИ уже умеет многое — читать статьи, писать код, запускать эксперименты. Но он пока не умеет думать стратегически и улучшать свою работу со временем. У него нет "исследовательского чутья", которое позволяет людям учиться, переосмыслять и адаптироваться. И всё же, это только начало.
Авторы подчёркивают: эти результаты — не потолок возможностей моделей.
Post #415
509

- ❤ 8
- ⚡ 3
- 👍 3
- 🔥 1