TGViewer
🌐Как ИИ меняет бизнес🌐 🌐Как ИИ меняет бизнес🌐 @pro10data · 1.24K subscribers
Post #415 509
🔬 Может ли ИИ стать настоящим учёным?

В моём дипломе по окончании аспирантуры написано: «исследователь». И в этом звании — суть человеческого стремления к новому, к открытиям, к преодолению границ знания.

Но способен ли на это искусственный интеллект?

Недавно я наткнулся на статью "PaperBench: Оценка способности ИИ воспроизводить исследования ИИ", и это одна из недавних попыток ответить на этот вопрос.

Исследователи разработали бенчмарк — PaperBench — который тестирует, может ли ИИ-агент самостоятельно воспроизвести современную научную работу в области машинного обучения: понять её, переписать код с нуля, провести эксперименты и получить те же результаты, что и авторы оригинала.

Что внутри PaperBench:

- 20 современных научных статей по ML, написанных учёными
- Каждая статья разбита на «рубрики» — отдельные научные результаты (всего 8316 таких элементов).
- Каждый рубрикатор составлялся совместно с автором оригинальной статьи.
- Задача ИИ: воспроизвести результаты, не имея доступа к исходному коду авторов.

ИИ получает только саму статью и техническое приложение к ней. Он должен подготовить репозиторий с полным кодом и файлом playback.sh, который запускает воспроизведение эксперимента. Заявка засчитывается как успешная, если скрипт воспроизводит эмпирические результаты.

🔍Результаты:

- Тестировали GPT-4o, o1, o3-mini, DeepSeek-R1, Claude 3.5 Sonnet и Gemini 2.0 Flash.

- Лидером стал Claude 3.5 Sonnet с результатом 21% успешных воспроизведений (из 100%).

- Модель o1 показала 13.2%, остальные — менее 10%.

Все агенты сталкивались с проблемами в стратегическом планировании и выполнении многошаговых задач на длинной дистанции (временной лимит — 12 часов).

👨‍🔬А что насчёт людей?

В эксперименте участвовали и живые исследователи, которым дали 48 часов на аналогичную задачу (выборка из 3 статей). Их результат — 41.4% против 26.6% у o1.

Примечательно, что ИИ показывает быструю отдачу в первые часы (много кода, быстро), но дальше... тупик⛔️

📝 Что это говорит о текущем состоянии ИИ?

ИИ уже умеет многое — читать статьи, писать код, запускать эксперименты. Но он пока не умеет думать стратегически и улучшать свою работу со временем. У него нет "исследовательского чутья", которое позволяет людям учиться, переосмыслять и адаптироваться. И всё же, это только начало.

Авторы подчёркивают: эти результаты — не потолок возможностей моделей.
  • ❤ 8
  • ⚡ 3
  • 👍 3
  • 🔥 1
More from @pro10data
  1. Sep 14, 2026🚨Комментарий Трампа на призыв от лидеров ИИ компаний к замедлению развития технологии: «Е…
  2. Sep 10, 2026🤖💰 Экономика +32%, зарплаты офисных работников - вниз. Anthropic показала, как ИИ может…
  3. Sep 9, 2026🤯 OpenAI заявила, что ИИ решил одну из главных математических задач человечества И это оч…
  4. Sep 6, 2026🚫🤖 Не давайте GPT-6 Astra всем сотрудникам OpenAI выпустила GPT-6 Astra — свою новую све…
  5. Aug 26, 2026🤖💸 Билл Гейтс: "ИИ нужно обложить налогом. И некоторые профессии сознательно оставить лю…
  6. Aug 13, 2026🧪🌍 ИИ научился запускать «рынок» ещё до запуска продукта. И речь уже про миллиарды вирту…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →