GPT-5.4 и Gemini 3.1 не прошли бенчмарк
Официальный анонс нового бенчмарка ARC-AGI-3 показал критический разрыв между человеческим интеллектом и современными нейросетями
Там где человек справляется на 100%, нейронки не вышли даже в 1%
Стандартные тесты оценивают накопленные знания, а новый бенч тестирует способность ияй адаптироваться в незнакомой среде (без предварительной базы) и строить гипотезы на ровном месте, меняя под ситуацию.
💠Нейронки пока не умеют предсказывать события в нестандартном сценарии.
💠Они склонны навязчиво придерживаться первой гипотезы (тот момент, когда мы доуточняем но ияй непоколебима и проще начать новый диалог), не пересматривая при изменении условий.
💠Не может понять контекст и выстроить цепочку действий.
Предыдущие бенчмарки нейронкам давались достаточно быстро, в данном же случае для моделей это задача со звездочкой. И это доказывает, что пока ияй ходит по заученному, а не «мыслит» адаптивно.
Ияй вы или человек, можно проверить у ARC на сайте.
Довольно занимательная игра 😁 делитесь, сколько уровней прошли?
Post #396
112

- ❤ 1
- 🔥 1
- 😁 1