Недавно Google DeepMind опубликовала интересную статью, в которой проверила, как хорошо их модель Veo 3 справляется с задачами, связанными с физическим миром. Уже давно стало понятно, что Veo — это не просто модель для генерации видеоконтента, а нечто большее. Google видит в ней основу для создания world modeling систем, которые смогут обучать не только ИИ, но и агентов, роботов и, возможно, станут следующей ступенью в развитии ИИ в целом.
⚡️ Идея здесь в том, что Veo 3 должна стать «мостом» между текущими большими языковыми моделями (LLM) и более сложными, разумными системами типа AGI. Ведь как говорит Лекун, один из ведущих ученых в области ИИ, именно отсутствие полноценного понимания мира — это тот самый барьер, который отделяет нас от настоящего искусственного интеллекта.
Для того, чтобы проверить возможности Veo 3, ученые DeepMind решили протестировать модель на большом наборе задач. Сюда вошли:
• Лабиринты и задачи на логическое мышление.
• Моделирование физики, например, плавучесть, трение, отражение.
• Визуальные задачи с требованием рассуждений.
• Распознавание свойств объектов и многое другое.
📈 Что показали результаты?
— Решение новых задач: Veo 3 смогла решать задачи, которые не были явно прописаны в обучении. Например, детекция объектов, на которой модель не была обучена заранее. Для такой модели это серьёзное достижение.
— Chain-of-Frames: В сложных задачах, требующих пошагового визуального мышления, модель показала отличные результаты. На лабиринте размером 5 на 5 точность решения составила 78% на pass@10, что довольно неплохо для модели, которая изначально не была настроена на подобные задачи.
— Хорошее понимание физики: Veo 3 способна моделировать такие явления, как плавучесть, трение, отражения и преломления. Это уже далеко не базовый уровень, а серьезное продвижение в сторону реального понимания физики.
Задача, которую решает Veo 3, по сути, является альтернативой традиционному обучению на тексте. Вместо того, чтобы просто читать и анализировать информацию из текста, эта модель может понимать физику, моделировать ситуации и принимать решения на основе визуальной информации. Сейчас, конечно, её развитие ещё в стадии начальной, но кто знает, что будет через пару лет?
Data Science
