OpenAI выкатили PaperBench — бенчмарк, где ИИ пробует воспроизвести настоящую ML-статью: прочитать, разобраться, написать код с нуля, запустить эксперименты и получить те же результаты.
Что вышло:
— лучший агент (Claude 3.5) смог сделать в среднем только 21% от полного воспроизведения
— у людей (ML PhD) — 41%, и то за 48 часов
— модели хорошо начинают — пишут код, генерят план — но быстро выдыхаются. Не умеют держать фокус, не могут довести задачу до конца, запутываются на стадии дебага и итераций
Работа проделана большая, всё звучит серьёзно. Но есть важный момент — всё исследование сделано внутри OpenAI. То есть они сами придумали задание, сами писали рубрики, сами запускали агентов, сами оценивали. Невольно встаёт вопрос: насколько всё это объективно, и не подогнаны ли условия под нужный нарратив?
Так что пока по факту: ИИ умеет помогать — как технарь на ресерче — но до уровня автономного исследователя пока не дотягивает. И доверять таким бенчмаркам надо с головой, особенно когда их делает тот, кому выгодно выглядеть скромно.
@edtechhacker
Post #477
233
paperbench.pdf1.5 MB
- ❤🔥 2