🤖 Почему 99,9% на бенчмарке - это ещё не AGI
Друзья, привет,
сегодня в 15:00 по Москве участвую в прямом эфире Ai4Dev «AGI уже здесь?». Кому позволяет график, тоже подключайтесь :)
Повод громкий: GPT-6 Astra показала 99,9% на ARC-AGI-3. Но дьявол кроется в деталях: в стандартной среде результат составил 62,7%, а 99,9% модель получила с адаптером, который сохраняет состояние рассуждений.
Именно здесь начинается интересный разговор. Что мы на самом деле измеряем: интеллект модели, способность выполнять задачи на уровне человека или эффективность всей системы вокруг нее (харнеса) - памяти, инструментов, агентной обвязки и участия человека?
Для меня AGI - это не модель, которая идеально проходит тест.
Общий интеллект должен уметь:
• осваивать действительно незнакомые задачи, а не узнавать знакомый шаблон;
• переносить полученный опыт между разными областями знаний;
• вести длинный проект без постоянного присмотра и Human in the loop;
• замечать собственные ошибки и менять стратегию;
• устойчиво работать не только в лаборатории, но и в реальных процессах.
В эфире поспорим, где проходит граница между сильной моделью и общим интеллектом, кому принадлежит результат, как распределяется ответственность между человеком и ИИ и на каких задачах по-прежнему ломаются любые модели.
Формат - час живой дискуссии без презентаций.
🔴 Подключайтесь сегодня, 7 октября, в 15:00 МСК: прямая трансляция
И напишите в комментариях: что должен сделать ИИ, чтобы лично вы признали: «да, это уже AGI»?
#live
💬 ген ии | MAX
Post #2399
299

- ❤ 3
- 👍 2
- 🎉 2