GPT-5.4 Pro только что показал 38% на FrontierMath Tier 4 - одном из самых сложных математических бенчмарков.
Эти 50 исследовательских задач по математике могут занимать у математиков недели на решение.
Еще год назад лучший результат был 2% (модель o3).
Лучший open-source результат сейчас - 4.2% (Kimi K2.5).
Очень впечатляющий скачок.
Post #1031
3.4K

- ❤ 17
- 🔥 6
- 👎 2