TGViewer
Шонов говорит Шонов говорит @edtechhacker · 470 subscribers
Post #477 233
paperbench.pdf1.5 MB
OpenAI выкатили PaperBench — бенчмарк, где ИИ пробует воспроизвести настоящую ML-статью: прочитать, разобраться, написать код с нуля, запустить эксперименты и получить те же результаты.

Что вышло:
— лучший агент (Claude 3.5) смог сделать в среднем только 21% от полного воспроизведения
— у людей (ML PhD) — 41%, и то за 48 часов
— модели хорошо начинают — пишут код, генерят план — но быстро выдыхаются. Не умеют держать фокус, не могут довести задачу до конца, запутываются на стадии дебага и итераций

Работа проделана большая, всё звучит серьёзно. Но есть важный момент — всё исследование сделано внутри OpenAI. То есть они сами придумали задание, сами писали рубрики, сами запускали агентов, сами оценивали. Невольно встаёт вопрос: насколько всё это объективно, и не подогнаны ли условия под нужный нарратив?

Так что пока по факту: ИИ умеет помогать — как технарь на ресерче — но до уровня автономного исследователя пока не дотягивает. И доверять таким бенчмаркам надо с головой, особенно когда их делает тот, кому выгодно выглядеть скромно.

@edtechhacker
  • ❤‍🔥 2
More from @edtechhacker
  1. Sep 6, 2026Вышел второй выпуск «Шонов говорит» — «Откуда берутся идеи, философия целей и кто такие ви…
  2. Sep 4, 2026Пользователи чат гпт, прием, вы в сингулярности? Как оно вам?
  3. Jun 2, 2026Как рождение дочери смотивировало меня начать вайбкодить. Пятый месяц вайбкожу. Начал, ког…
  4. Apr 26, 2026Вайбкодинг от Бати, завел агенту учетку на гитхабе: Воскресный апдейт по вайбкодингу 👋 1.…
  5. Apr 10, 2026Post #574
  6. Apr 1, 2026⚡️ Четверо астронавтов США через 2 часа полетят на Луну. Облетят и вернутся назад. Трансля…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →