🧠 GPT‑5 по утечкам (или PR самого OpeAI) набрал 90% на SimpleBench — это уровень человека
По слухам, новый бенчмарк от Copilot показывает, что GPT‑5 достигает 90% точности на SimpleBench — наборе из ~200 сложных вопросов с множественным выбором.
❓ Что тестирует SimpleBench:
• Пространственно-временное мышление
• Социальную логику
• Адверсариальные ловушки на здравый смысл
📌 Почему это важно:
90% — это уже уровень человеческого здравого смысла в таких задачах. А ведь модели до этого еле приближались к этим значениям даже с цепочками размышлений.
Если слух подтвердится — GPT‑5 не просто умнее. Он начинает понимать контекст как человек.
@machinelearning_interview
Post #2024
5.74K

- 👍 35
- ❤ 8
- 🔥 5
- 😁 5
- 💊 2
- 👨💻 1