Бенчмарки спорят о GPT-6 Astra, но ARC-AGI-3 сдвигает прогноз Шолле по AGI
Новая модель OpenAI GPT-6 Astra получила противоположные оценки на разных бенчмарках. Epoch ИИ поставила её на первое место среди 267 моделей с результатом 169 баллов, тогда как Artificial Analysis дала Astra 61 балл — столько же, сколько предшественнице, — и поставила ниже Claude Fable 5.1 с 66 баллами. Главный результат пришёлся на ARC-AGI-3: Astra впервые прошла игровые задачи эффективнее среднего человека, набрав 62,7% против 7,78% у GPT-5.6 Sol и 30,16% у Claude Opus 5. Франсуа Шолле, руководитель ARC Prize, считает, что модель появилась примерно вдвое раньше ожидаемого и из-за ускорения прогресса сдвинул прогноз AGI на более ранний срок.
👉 Читать полностью
Post #6861
11