У GPT-5.6 Sol на тесте ARC-AGI-3 было 7,8%.
У новой GPT-6 Astra появилась громкая цифра в 99,9%, из-за которой сеть сразу заговорила о достижении AGI.
Но у той же Astra на этом же тесте есть и второй официальный результат — 62,7%. И обе цифры абсолютно реальны.
Всё упирается в то, как именно тестируют модель.
Оценивать только «голую» нейросеть больше нет смысла: решающую роль играют системный контекст, память, тестовая среда и количество попыток, которые дают агенту на задачу.
Мы решили убрать синтетические бенчмарки и столкнуть Astra, Fable и Sol на двух одинаковых прикладных задачах без права на ошибку.
В новом ролике разбираем реальный разрыв между поколениями моделей и показываем, где Astra действительно совершила рывок, а где бенчмарки создают иллюзию.
В видео показываем::
▶️Что на самом деле измеряет ARC-AGI-3 и почему 99,9% не означают AGI
▶️Откуда взялась двойная оценка Astra: разница между 62,7% и 99,9%
▶️Astra vs Fable vs Sol: сборка интерактивной чёрной дыры с одного промпта
▶️Стресс-тест: создание локального браузерного анализатора переписок Telegram
▶️Слабые места Astra: в каких сценариях Fable всё ещё стабильнее и чище
▶️Итоговый вердикт: стоит ли переходить на новое поколение в реальной работе
Ссылка на видео:
https://youtu.be/nCp7ZM9G3AI
https://youtu.be/nCp7ZM9G3AI
https://youtu.be/nCp7ZM9G3AI
Оба промпта из ролика и исходники тестовых проектов выложили в комментариях, чтобы вы могли прогнать их на своих задачах.
Если такие большие сравнения заходят, поставьте лайк ролику и дайте реакцию на этот пост — так понятно, что мы не зря старались и тратили кучу лимитов.
Подписывайтесь на наш YouTube канал — на нём будет ещё больше обучающего и полезного контента.
✊ Paragon | Чат | YouTube
