OpenAI подловили на несостыковке: народ в соцсетях взбунтовался — заявленные метрики декабрьской o3 не совпадают с тем, что выкатили в паблик.
В декабре на презентации всё выглядело как сказка: 25% на FrontierMath и 88% на ARC AGI. Но в реальности мы получили куда скромнее цифры — 10% и 35-40%. Что пошло не так?
Во-первых, скорее всего, в декабре показывали не обычную o3, а какую-то про-версию, да ещё и на максимальных настройках. Во-вторых, сами бенчмарки с тех пор обновились — в FrontierMath стало почти в два раза больше задач, и они усложнились. Наконец, модель, которую мы сейчас видим, упрощена под реальный юзкейс — быстрее, дешевле, но с компромиссом в точности.
Короче, с бенчмарками всегда так: смотрим, сравниваем, но не верим слепо. Особенно если на кону маркетинг.
❤️ Data Signal
Post #81
841



- 👍 4
- ❤ 2
- 🔥 1