Все бенчмарки на проверку AGI оказались бредом — топовым нейронкам ещё очень далеко до человеческого интеллекта, а доказала это обычная игра-симулятор парка аттракционов Roller Coaster Tycoon 2
Стартап Skyfall AI
раскритиковал самый популярный бенчмарк ARC-AGI на «абстрактное мышление» — нам всё это время показывали иллюзию мышления, на самом деле бенчмарк даёт возможность нейронкам откатить свои ошибки и приходить к правильному результату только через 100500 повторений. А реальная жизнь гораздо непредсказуемее и не прощает ошибок, считают спецы Skyfall.
Я уже
писал про эксперимент с Roller Coaster Tycoon, где Claude сделал невероятный результат, НО Skyfall сделал повторную сессию с топовыми моделями, где всё рассчитано на долгосрок, пространственное мышление, умение предвидеть и не делать необратимые ошибки. Результаты:
• НИКТО из нейронок не умеет в пространственное мышление — GPT-5.4 строил аттракционы, у которых вход/выход упирался в стену, и гости не могли попасть на них. Gemini перестраивал парк по 3 раза, но тоже не справился
• Никто из нейронок не заботился о безопасности посетителей — Claude (тот самый лучший менеджер среди всех) игнорировал ошибки, сносил пути с людьми на них, оставлял гостей в ловушке, не нанимал охрану заранее, что вызывало вандализм и падение рейтинга парка
• Все топовые ИИ решают только текущие мелкие проблемы и не думают о долгосрочных последствиях
В общем, ИИ пока на уровне амёбы на задачах, где нужно действительно думать. Спим спокойно 🤷♂️
Пет-проект