👁 Исследователи DeepMind, Гарварда и Стэнфорда обсуждают путь к AGI через зрение
В статье Visual General Intelligence авторы предлагают развивать ИИ, который учится на изображениях, видео, трёхмерной геометрии и взаимодействии с окружающей средой.
Такая система должна уметь:
* строить модель мира — понимать объекты, пространство и связи между ними;
* запоминать изменения — сохранять представление о происходящем между наблюдениями;
* предсказывать последствия действий и учитывать скрытые части сцены;
* собирать недостающую информацию — выбирать, куда посмотреть перед действием;
* учиться на новом опыте, обновляя накопленные знания.
Среди возможных компонентов — генерация видео, реконструкция сцен, долговременная память, непрерывное обучение и робототехника.
Оценивать такие системы авторы предлагают по способности предсказывать, адаптироваться и действовать в незнакомой среде. Ответов на вопросы по картинкам и реалистичного видео для этого недостаточно.
Работа объединяет несколько исследовательских подходов. Готовой архитектуры AGI в ней пока нет.
Статья - https://arxiv.org/abs/2608.25924
Post #5766
4.26K

- ❤ 14
- 👍 9
- 🔥 3