TGViewer
Вайб-кодинг Вайб-кодинг @vibecoding_tg · 64.3K subscribers
Post #2878 10.2K
Люди: 100%
Gemini 3.1 Pro: 0.37%
GPT 5.4: 0.26%
Opus 4.6: 0.25%
Grok-4.20: 0.00%

Франсуа Шолле выпустил ARC-AGI-3 — самый сложный тест для ИИ на сегодняшний день.

135 новых игровых сред. Без инструкций. Без правил. Без заданных целей.

Разбирайся сам или проваливайся.

Неподготовленные люди справились со всеми заданиями. Все передовые модели ИИ набрали меньше 1%.

Каждая среда была вручную разработана гейм-дизайнерами. ИИ помещается в неё и должен исследовать, понять, что считается победой, и адаптироваться в реальном времени.

Система оценки наказывает брутфорс. Если человеку нужно 10 действий, а ИИ — 100, то ИИ получает не 10%, а 1%. Просто нарастить вычисления не получится.

Для контекста: ARC-AGI-1 практически решён. Gemini набирает на нём 98%. ARC-AGI-2 вырос с 3% до 77% менее чем за год. Лаборатории потратили миллионы на обучение на предыдущих версиях.

ARC-AGI-3 обнуляет прогресс — результаты снова близки к нулю.

Бенчмарк был представлен на Y Combinator в формате публичной беседы между Шолле и Сэмом Альтманом.

Призовой фонд — $2 млн на Kaggle. Все победившие решения должны быть с открытым исходным кодом.

Одного масштабирования недостаточно, чтобы закрыть этот разрыв. До AGI нам ещё очень далеко.

Если интересно, вот ссылка 😭
More from @vibecoding_tg
  1. Oct 9, 2026Техническая команда Inditex, стоящая за Zara, опубликовала инструменты, которыми пользуетс…
  2. Oct 9, 2026Claude, пожалуйста, найди инопланетян. Не допусти ни одной ошибки. Какой-то чувак считает,…
  3. Oct 9, 2026Anthropic официально запрещает "оскорбительное или жестокое обращение" с Claude Дарио Амод…
  4. Oct 9, 2026OpenAI завезли GPT-6.1 Sol Ultrafast. Команда постепенно запускает его в API, Codex и Chat…
  5. Oct 9, 2026Post #4055
  6. Oct 8, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →