IQ & AI
Новые результаты от ребят из A Maximum Truth Project, основательно отслеживающих прогресс ИИ в прохождении IQ-тестов. Раньше они полагались на тесты норвежского филиала общества Менса, а сейчас также используют собственные закрытые оффлайн-тесты, которые гарантировано ни в каком виде недоступны моделям во время обучения.
В этих оффлайн-тестах Gemini 2.5 набирает 118 баллов (>85% людей), что делает её первой модель в явном виде скакнувшей в способностях к рассуждениям дальше большинства людей.
В тестах же IQ от Mensa баллы модели подскакивают до 130 (>95% людей), тогда как в прошлом марте лучшие версии Gemini набирали 76-78 баллов, т.е. по этому тесту прирост за год составил 50+ баллов.
Опять же, стоит держать в голове все оговорки насчёт валидности тестов и самой концепции IQ, но и преуменьшать феноменальность этого прогресса и его последствий не стоит.
Post #227
613

- ❤ 10
- 🔥 2
- 🤯 2