TGViewer
Data Scientist | ML & AI Data Scientist | ML & AI @datascience_tg · 3.05K subscribers
Post #81 841
OpenAI подловили на несостыковке: народ в соцсетях взбунтовался — заявленные метрики декабрьской o3 не совпадают с тем, что выкатили в паблик.

В декабре на презентации всё выглядело как сказка: 25% на FrontierMath и 88% на ARC AGI. Но в реальности мы получили куда скромнее цифры — 10% и 35-40%. Что пошло не так?

Во-первых, скорее всего, в декабре показывали не обычную o3, а какую-то про-версию, да ещё и на максимальных настройках. Во-вторых, сами бенчмарки с тех пор обновились — в FrontierMath стало почти в два раза больше задач, и они усложнились. Наконец, модель, которую мы сейчас видим, упрощена под реальный юзкейс — быстрее, дешевле, но с компромиссом в точности.

Короче, с бенчмарками всегда так: смотрим, сравниваем, но не верим слепо. Особенно если на кону маркетинг.

❤️ Data Signal
  • 👍 4
  • ❤ 2
  • 🔥 1
More from @datascience_tg
  1. Oct 9, 2026📰 Глубокий разбор RAG: от архитектуры до продакшена В статье весь пайплайн раскладывают п…
  2. Oct 9, 2026ТОП 5 каналов для тех, кто увлекается IT и хакингом ☁️ CodeGuard: PySec Edition 🤒 CodeGua…
  3. Oct 8, 2026🔖 Официальные туториалы PyTorch В подборке есть: 🫡 Основы PyTorch и torch.nn; 🫡 Compute…
  4. Oct 7, 2026🔖 Один из главных инструментов для табличного ML XGBoost — оптимизированная библиотека гр…
  5. Oct 6, 2026📰 RAG без фреймворков: руками и по шагам В разборе показывают, как собрать RAG с нуля: ча…
  6. Oct 5, 2026🔖 Быстрый градиентный бустинг для больших данных LightGBM умеет обучаться на CPU и GPU, п…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →